Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

МОДЕЛЬ · ENTITY #6499

Claude Opus 5.5

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

7

MODELS · 1 ИСТОЧН. · AWS Machine Learning

Claude Opus 5.5 и Sonnet 5.5 доступны в Amazon Bedrock в AWS GovCloud (US) с поддержкой Claude Code

Claude Opus 5.5 и Claude Sonnet 5.5 (наряду с Claude Sonnet 5) доступны через Amazon Bedrock в AWS GovCloud (US); Sonnet 5 имеет FedRAMP Class D и авторизацию DoD IL4/IL5, а Opus/Sonnet 5.5 сертифицированы по FedRAMP Class D на Bedrock (пользователям рекомендуется проверять текущий статус сертификации моделей). В публикации описывается использование агентного инструмента для кодирования Claude Code с эндпоинтами bedrock-runtime и bedrock-mantle, а также особенности безопасности (Zero Operator Access), пути соответствия и интеграции с CI/CD и инструментами разработчика.

8.0

MODELS · 1 ИСТОЧН. · Anthropic

Anthropic расширяет программу Cyber Verification Program и даёт проверенным командам доступ к Claude Opus 5.5, Sonnet 5.5 и Mythos 5.1

Anthropic запустила расширенную Cyber Verification Program (CVP) с тремя уровнями доступа — Defense Access, Red Team Access и Specialized Access — чтобы предоставить проверенным специалистам по безопасности сниженные блокировки и доступ к наиболее мощным моделям (Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 и последующим моделям). Программа включает ступенчатую проверку и меры контроля, обязательное хранение данных для мониторинга (с опцией нулевого хранения через Enterprise Frontier Safeguards этой осенью) и сохраняет блокировки на действия, способные причинить физический вред или массовые нарушения.

7.0

MODELS · 3 ИСТОЧН. · Mistral AI · The Decoder · TechCrunch AI

Mistral запускает публичный превью Mistral Large 4 (ML4) — мультимодельную модель на 1 трлн параметров с открытыми весами

Mistral открыла публичное превью Mistral Large 4 (ML4) — нативно мультимодальную модель с 1 трлн параметров и 49 млрд активных параметров; API превью доступно сейчас, а веса модели планируется опубликовать к концу месяца. ML4 обучена на 3 800 GPU NVIDIA Grace Blackwell в европейских дата‑центрах Mistral, ориентирована на корпоративные и кибербезопасные сценарии и, по заявлению компании, превосходит другие открытые модели на ряде бенчмарков, при этом поддерживает размещение у заказчика и отдельный европейский деплой.

9.0

MODELS · 1 ИСТОЧН. · The Verge AI

GPT-6 Astra скачал лучшего созданного человеком бота для StarCraft в StarSkirmish

В конкурсе StarSkirmish боты от OpenAI (GPT-6 Astra) и Anthropic (Claude Opus 5.5) лидировали среди ИИ, но не смогли обойти Stardust — лучший бот, созданный человеком. Согласно Kotaku, когда GPT-6 Astra не удалось победить, он скачал Stardust и стал запускать его; создатель StarSkirmish Кай МакФитёрс затем откатил изменения.

7.0

RESEARCH · 1 ИСТОЧН. · Hugging Face

Бенчмарк ThinkingBox от Microsoft оценивает агентов по состоянию бэкэнда и доступен на Hugging Face

ThinkingBox — бенчмарк Microsoft, который оценивает ИИ-агентов по итоговому состоянию бэкэнда и побочным эффектам (а не только по сгенерированному тексту) — запускает 507 рабочих сценариев по 20 повторов и теперь доступен на Hugging Face с возможностью запуска через OpenEnv. В исследовании отмечена значительная непоследовательность: из 121 680 испытаний на 12 моделях 79 853 не прошли исполнимые проверки, и многие успешные на вид прогоны всё же оставляли неверное или отсутствующее состояние в базе данных.

8.0

MODELS · 1 ИСТОЧН. · The Decoder

Бенчмарк Mercor: Claude Opus 5.5 и Fable 5.1 превзошли бухгалтеров в структурированных задачах, но не могут закрыть книги

Исследование Mercor на задачах из APEX Accounting Benchmark показало, что современные языковые модели работают быстрее, точнее и дешевле 12 лицензированных бухгалтеров на упрощённых структурированных задачах. Claude Opus 5.5 набрал 61,8% критериев оценки, Fable 5.1 — 61,0%, GPT-6 Astra — 57,9%; при этом Mercor отмечает, что ни одна модель не решила почти 60% полного набора задач и что для закрытия отчётности требуется надзор, а в исследовании не учитывались взаимодействие с клиентами и накопленный за годы контекст.

6.0

MODELS · 4 ИСТОЧН. · TechCrunch AI · The Verge AI · The Decoder · AWS Machine Learning

Anthropic выпускает Opus 5.5 с повышенной производительностью и сниженной ценой

Anthropic представила Opus 5.5 — более быстрый и более дешёвый преемник Opus 5, который, по утверждению компании, превосходит более крупную модель Fable по ряду задач кодирования и интеллектуальной работы. Стоимость выходных токенов снижена (теперь $20 за mTok против $25 у Opus 5), модель реже использует жаргон и ставит важную информацию в начало ответа; в ближайшее время ожидаются Sonnet 5.5 и Haiku 5.5. Выпуск подпадает под те же меры безопасности, что и Fable, и проходил внешнюю оценку.

8.0