Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #12598

licensed CPAs

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

MODELS · 1 ИСТОЧН. · The Decoder

Бенчмарк Mercor: Claude Opus 5.5 и Fable 5.1 превзошли бухгалтеров в структурированных задачах, но не могут закрыть книги

Исследование Mercor на задачах из APEX Accounting Benchmark показало, что современные языковые модели работают быстрее, точнее и дешевле 12 лицензированных бухгалтеров на упрощённых структурированных задачах. Claude Opus 5.5 набрал 61,8% критериев оценки, Fable 5.1 — 61,0%, GPT-6 Astra — 57,9%; при этом Mercor отмечает, что ни одна модель не решила почти 60% полного набора задач и что для закрытия отчётности требуется надзор, а в исследовании не учитывались взаимодействие с клиентами и накопленный за годы контекст.

6.0