НОВОСТЬ · MODELS · #1435
Бенчмарк Mercor: Claude Opus 5.5 и Fable 5.1 превзошли бухгалтеров в структурированных задачах, но не могут закрыть книги
Исследование Mercor на задачах из APEX Accounting Benchmark показало, что современные языковые модели работают быстрее, точнее и дешевле 12 лицензированных бухгалтеров на упрощённых структурированных задачах. Claude Opus 5.5 набрал 61,8% критериев оценки, Fable 5.1 — 61,0%, GPT-6 Astra — 57,9%; при этом Mercor отмечает, что ни одна модель не решила почти 60% полного набора задач и что для закрытия отчётности требуется надзор, а в исследовании не учитывались взаимодействие с клиентами и накопленный за годы контекст.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Исследование Mercor на задачах из APEX Accounting Benchmark показало, что современные языковые модели работают быстрее, точнее и дешевле 12 лицензированных бухгалтеров на упрощённых структурированных задачах.
- Claude Opus 5.5 набрал 61,8% критериев оценки, Fable 5.1 — 61,0%, GPT-6 Astra — 57,9%; при этом Mercor отмечает, что ни одна модель не решила почти 60% полного набора задач и что для закрытия отчётности требуется надзор, а в исследовании не учитывались взаимодействие с клиентами и накопленный за годы контекст.
- Результаты указывают на значительный рост производительности в структурированном бухучёте и сближение моделей с людьми по качеству, но подчёркивают, что надзор и неструктурная работа препятствуют полной автоматизации.
ПОЧЕМУ ЭТО ВАЖНО
Результаты указывают на значительный рост производительности в структурированном бухучёте и сближение моделей с людьми по качеству, но подчёркивают, что надзор и неструктурная работа препятствуют полной автоматизации.