Бенчмарк Mercor: Claude Opus 5.5 и Fable 5.1 превзошли бухгалтеров в структурированных задачах, но не могут закрыть книги
Исследование Mercor на задачах из APEX Accounting Benchmark показало, что современные языковые модели работают быстрее, точнее и дешевле 12 лицензированных бухгалтеров на упрощённых структурированных задачах. Claude Opus 5.5 набрал 61,8% критериев оценки, Fable 5.1 — 61,0%, GPT-6 Astra — 57,9%; при этом Mercor отмечает, что ни одна модель не решила почти 60% полного набора задач и что для закрытия отчётности требуется надзор, а в исследовании не учитывались взаимодействие с клиентами и накопленный за годы контекст.