Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

НОВОСТЬ · MODELS · #1435

Бенчмарк Mercor: Claude Opus 5.5 и Fable 5.1 превзошли бухгалтеров в структурированных задачах, но не могут закрыть книги

Исследование Mercor на задачах из APEX Accounting Benchmark показало, что современные языковые модели работают быстрее, точнее и дешевле 12 лицензированных бухгалтеров на упрощённых структурированных задачах. Claude Opus 5.5 набрал 61,8% критериев оценки, Fable 5.1 — 61,0%, GPT-6 Astra — 57,9%; при этом Mercor отмечает, что ни одна модель не решила почти 60% полного набора задач и что для закрытия отчётности требуется надзор, а в исследовании не учитывались взаимодействие с клиентами и накопленный за годы контекст.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Исследование Mercor на задачах из APEX Accounting Benchmark показало, что современные языковые модели работают быстрее, точнее и дешевле 12 лицензированных бухгалтеров на упрощённых структурированных задачах.
  2. Claude Opus 5.5 набрал 61,8% критериев оценки, Fable 5.1 — 61,0%, GPT-6 Astra — 57,9%; при этом Mercor отмечает, что ни одна модель не решила почти 60% полного набора задач и что для закрытия отчётности требуется надзор, а в исследовании не учитывались взаимодействие с клиентами и накопленный за годы контекст.
  3. Результаты указывают на значительный рост производительности в структурированном бухучёте и сближение моделей с людьми по качеству, но подчёркивают, что надзор и неструктурная работа препятствуют полной автоматизации.

ПОЧЕМУ ЭТО ВАЖНО

Результаты указывают на значительный рост производительности в структурированном бухучёте и сближение моделей с людьми по качеству, но подчёркивают, что надзор и неструктурная работа препятствуют полной автоматизации.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1