Tech Meridian ← К СУЩНОСТЯМ
EN

МОДЕЛЬ · ENTITY #3707

Claude Opus 4.8

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

MODELS · 4 ИСТОЧН. · Anthropic · TechCrunch AI · The Verge AI · The Decoder

Anthropic выпускает Claude Opus 5 — недорогая модель с близкой к фронтирной мощностью

Anthropic объявила Claude Opus 5 — новую модель, позиционируемую как более экономичный преемник Opus 4.8 и новый стандарт по умолчанию в Claude Max (а также сильнейшую в Claude Pro). По данным Anthropic, Opus 5 достигла или превзошла предыдущие модели на ряде бенчмарков для программирования, задач знания и науки (Frontier‑Bench, GDPval‑AA, CursorBench, ARC‑AGI, Zapier AutomationBench, OSWorld) при меньшей стоимости выполнения, но отстаёт от Mythos 5 в задачах по кибербезопасности и биологии; компания также указывает на улучшенную выравненность и безопасность и публикует System Card.

8.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья на arXiv представляет бенчмарк SAFE для проверки, запрашивают ли передовые модели данные о безопасности перед действием

В работе (arXiv:2609.17865v1) представлен SAFE — контролируемый бенчмарк, в котором модели решают, запрашивать ли дополнительную информацию о безопасности, меняя её стоимость, вероятность, серьёзность и подачу. При оценке GPT-5.5, o3, Claude Opus 4.8 и Claude Sonnet 4.6 авторы обнаружили разные политики запроса доказательств (Opus почти всегда проверяет, o3 чаще пропускает, GPT-5.5 и Sonnet — промежуточно), сильную зависимость от серьёзности и стоимости доступа, слабую от вероятности, и рассогласование между объяснениями моделей и фактическим поведением.

7.0