Tech Meridian ← К СУЩНОСТЯМ
EN

МОДЕЛЬ · ENTITY #490

GPT-5.5

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

5

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья на arXiv сравнивает двухагентную и однократную проверку резюме с GPT-5.5 и Claude Opus 4.7

Предварительная статья на arXiv (arXiv:2609.19530v1) сравнивает традиционную однократную проверку резюме и протокол с двумя агентами, которые обмениваются доказательствами, применяя GPT-5.5 и Claude Opus 4.7 на 600 составленных парах «резюме—вакансия». Двухагентная схема пропускала больше заявок в целом (GPT-5.5: 33.3%→39.3%; Opus 4.7: 34.0%→35.5%), значительно увеличивала долю проходов в 191-парном «пограничном» наборе (GPT-5.5: 4.5%→26.2%; Opus 4.7: 6.5%→16.1%), меняла решения в обе стороны и приводила к отбору заявок, которые реже повторялись при повторных запусках (особенно для GPT-5.5).

7.0

MODELS · 1 ИСТОЧН. · The Decoder

GPT‑6 Astra от Vals AI достигает прорывов в сложных игровых задачах и в ARC‑AGI‑3

По данным Vals AI и сообществ, GPT‑6 Astra достигла удалённых игровых целей в Minecraft (построила портал в Нижний мир и собрала ресурсы до того, как Крипер уничтожил сундук), прошла Pokemon FireRed примерно за 18 часов (у GPT‑5.6 Sol — около 96 часов), запустила ракету в Factorio примерно за 10 часов и показала около 62,7% по бенчмарку ARC‑AGI‑3 (у GPT‑5.6 Sol — ≈7,78%). ARC Prize и Vals AI объясняют прогресс тем, что Astra переводит наблюдения в компактные символические правила и использует их для планирования, работая через обычный экран/мышь/клавиатуру.

8.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья на arXiv представляет бенчмарк SAFE для проверки, запрашивают ли передовые модели данные о безопасности перед действием

В работе (arXiv:2609.17865v1) представлен SAFE — контролируемый бенчмарк, в котором модели решают, запрашивать ли дополнительную информацию о безопасности, меняя её стоимость, вероятность, серьёзность и подачу. При оценке GPT-5.5, o3, Claude Opus 4.8 и Claude Sonnet 4.6 авторы обнаружили разные политики запроса доказательств (Opus почти всегда проверяет, o3 чаще пропускает, GPT-5.5 и Sonnet — промежуточно), сильную зависимость от серьёзности и стоимости доступа, слабую от вероятности, и рассогласование между объяснениями моделей и фактическим поведением.

7.0

MODELS · 1 ИСТОЧН. · Cohere

Cohere представила Parse — модель для высокопроизводительного парсинга документов для бизнеса

Cohere выпустила Parse — мульти модальную модель парсинга документов для корпоративных задач, доступную через Cohere API, стек Compass и частную платформу Model Vault. Компания заявляет о выгодной цене ($1,50 за 1 000 страниц), высокой пропускной способности и лучшем соотношении цена–качество по ParseBench по сравнению с рядом специализированных решений и сервисов гипермасштаберов.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Continual Search: итеративный подход улучшает установление первопричин сбоев агентов на длинных горизонтах

Новая статья в arXiv (arXiv:2609.13463v1) рассматривает установление первопричин (RCA) сбоев агентов на длинных горизонтах как задачу поиска и предлагает Continual Search — итеративную схему, вынуждающую оценщика на основе LLM многократно искать невыявленные диагностические доказательства. Авторы также представляют MegaRCA-Mix, набор из 50 тестов для задач с длительными исполнениями, и показывают, что Continual Search повышает качество атрибуции (например, F1 GPT-5.5 выросла с 0.349 до 0.498).

7.0