Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · COMPANIES · #627

Anthropic заявляет, что Claude «ведёт» 26% исследований, но определение и оценка неясны

Anthropic опубликовала внутренние метрики: по состоянию на август 2026 года Claude составляет 26% работ по разработке моделей на уровне AL4 («AI ведёт»), более 90% достигают как минимум AL3; уровни присваивались агентами, собиравшими внутренние логи, и моделью Claude, выставлявшей оценки. Компания также указала данные мониторинга (около 30 000 одновременных агентов, блокировка 0,002% из >1 млрд действий в августе) и что примерно 6% вычислительных ресурсов исследований ушли на работу по безопасности, признавая при этом неясность границ уровней и ограничения самооценки.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Anthropic опубликовала внутренние метрики: по состоянию на август 2026 года Claude составляет 26% работ по разработке моделей на уровне AL4 («AI ведёт»), более 90% достигают как минимум AL3; уровни присваивались агентами, собиравшими внутренние логи, и моделью Claude, выставлявшей оценки.
  2. Компания также указала данные мониторинга (около 30 000 одновременных агентов, блокировка 0,002% из >1 млрд действий в августе) и что примерно 6% вычислительных ресурсов исследований ушли на работу по безопасности, признавая при этом неясность границ уровней и ограничения самооценки.
  3. Публикация демонстрирует прогресс в автоматизации исследований и ограничения самоотчётных метрик автономности — определения, методы измерения и самооценка влияют на доверие, сравнения и политические дебаты о замедлении развития передового ИИ.

ПОЧЕМУ ЭТО ВАЖНО

Публикация демонстрирует прогресс в автоматизации исследований и ограничения самоотчётных метрик автономности — определения, методы измерения и самооценка влияют на доверие, сравнения и политические дебаты о замедлении развития передового ИИ.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1