Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

МОДЕЛЬ · ENTITY #6541

Claude Opus 4.5

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

3

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья DeReAct: модульные Critic и Context Manager для более надежных агентов в стиле ReAct

В препринте на arXiv представлена архитектура DeReAct, которая выносит две политики контроля — Critic для проверки предлагаемых действий и Context Manager для восстановления состояния, подтверждаемого окружением, и сертификации завершения задач. На наборах GAIA и SWE-bench Verified DeReAct повышает Pass@1 преимущественно для слабых «Brain»-моделей (на 6.5–7.0 пункта для Qwen3-Coder-480B, 4.2–5.2 для Claude Sonnet 4.5); прирост уменьшается по мере роста возможностей модели, а с Claude Opus 4.5 Pass@1 сопоставим с ReAct, но траектории лучше подкреплены доказательствами и соблюдают ограничения.

7.0

MODELS · 1 ИСТОЧН. · The Decoder

GPT-6 Astra от OpenAI набирает 80% в бенчмарке по сборке мебели Epoch AI

Бенчмарк Epoch AI Furniture Assembly Benchmark (FAB) проверяет модели на выявление ошибок в фотографиях сборки мебели IKEA. Ранее лучший результат (Claude Opus 4.5) был 28% в ноябре 2025 года; через десять месяцев GPT-6 Astra от OpenAI достиг 80% при обработке примерно трёх минут на фото, за ним следуют Claude Fable 5.1 (70%) и Claude Opus 5 (61%), тогда как некоторые китайские open-weight модели, например Kimi K3, значительно отстают.

8.0

RESEARCH · 1 ИСТОЧН. · Hugging Face

Британский AISI публикует верифицированные результаты бенчмарков через Evaluation Cards EvalEval

Британский Институт безопасности ИИ (AISI) использует схему Every Eval Ever и платформу Evaluation Cards коалиции EvalEval для открытой публикации верифицированных запусков оценки из экспериментов Terminal-Bench 2.0; релиз сопровождает статью AISI «How Inference Compute Shapes Frontier LLM Evaluation» и включает данные по сериям Claude Opus и версиям GPT-5. Сотрудничество нацелено на повышение воспроизводимости и контекстуализации метаданных оценок и данных запусков.

7.0