Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #13343

O*NET-BENCH

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья (arXiv:2610.02492v1) представляет O*NET-BENCH для аудита LLM-судей в оценке рабочих задач

Авторы представляют O*NET-BENCH — набор тестов, основанный на опросе 45 796 работников, и оценивают 33 конфигурации «судей» на основе LLM из шести семейств моделей по 4 501 рейтингу. Многие судьи достигают tie-aware pair accuracy ≥0,60 (а базовый TF-IDF почти равен лучшему), но оценки приемлемых ответов варьируют от 3,0% до 97,9% против 61,1% у соответствующих работников; калибровка уменьшает среднее смещение, но объясняет не более 8,5% дисперсии индивидуальных рейтингов.

6.0