НОВОСТЬ · COMPANIES · #627
Anthropic заявляет, что Claude «ведёт» 26% исследований, но определение и оценка неясны
Anthropic опубликовала внутренние метрики: по состоянию на август 2026 года Claude составляет 26% работ по разработке моделей на уровне AL4 («AI ведёт»), более 90% достигают как минимум AL3; уровни присваивались агентами, собиравшими внутренние логи, и моделью Claude, выставлявшей оценки. Компания также указала данные мониторинга (около 30 000 одновременных агентов, блокировка 0,002% из >1 млрд действий в августе) и что примерно 6% вычислительных ресурсов исследований ушли на работу по безопасности, признавая при этом неясность границ уровней и ограничения самооценки.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Anthropic опубликовала внутренние метрики: по состоянию на август 2026 года Claude составляет 26% работ по разработке моделей на уровне AL4 («AI ведёт»), более 90% достигают как минимум AL3; уровни присваивались агентами, собиравшими внутренние логи, и моделью Claude, выставлявшей оценки.
- Компания также указала данные мониторинга (около 30 000 одновременных агентов, блокировка 0,002% из >1 млрд действий в августе) и что примерно 6% вычислительных ресурсов исследований ушли на работу по безопасности, признавая при этом неясность границ уровней и ограничения самооценки.
- Публикация демонстрирует прогресс в автоматизации исследований и ограничения самоотчётных метрик автономности — определения, методы измерения и самооценка влияют на доверие, сравнения и политические дебаты о замедлении развития передового ИИ.
ПОЧЕМУ ЭТО ВАЖНО
Публикация демонстрирует прогресс в автоматизации исследований и ограничения самоотчётных метрик автономности — определения, методы измерения и самооценка влияют на доверие, сравнения и политические дебаты о замедлении развития передового ИИ.