Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #6851

LLM judges

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

4

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья (arXiv:2610.02492v1) представляет O*NET-BENCH для аудита LLM-судей в оценке рабочих задач

Авторы представляют O*NET-BENCH — набор тестов, основанный на опросе 45 796 работников, и оценивают 33 конфигурации «судей» на основе LLM из шести семейств моделей по 4 501 рейтингу. Многие судьи достигают tie-aware pair accuracy ≥0,60 (а базовый TF-IDF почти равен лучшему), но оценки приемлемых ответов варьируют от 3,0% до 97,9% против 61,1% у соответствующих работников; калибровка уменьшает среднее смещение, но объясняет не более 8,5% дисперсии индивидуальных рейтингов.

6.0

MODELS · 1 ИСТОЧН. · arXiv cs.AI

Hapi: U‑Net Swin Transformer для континентальных 24–72‑часовых гидрологических прогнозов

Hapi — многопеременный U‑Net Swin Transformer, прогнозирующий сток, поверхностный сток, водный эквивалент снега и влажность почвы по территории континентальных США с разрешением 0,05° на 24–72 часа. На тестовых данных 2024 года с реконструированными входами ERA5‑Land модель превзошла эксплуатационную физическую модель и современную AI‑модель в обнаружении наводнений, прошла валидацию по 3 881 гиду USGS и исследованию урагана Helene, и выполняет 72‑часовой прогноз по четырём переменным в среднем за 0,11 с на одной A100 GPU.

8.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

AutoGym: фреймворк «сначала план» для синтеза проверяемых агентных гимов

Статья (arXiv:2609.22592v1) представляет AutoGym — фреймворк для автоматической генерации полных RL‑гимов (задачи, исполняемая среда и верификатор) от минимального доменного семени или предыдущих траекторий. AutoGym объединяет (1) «сначала план» (blueprint‑first), задающий допустимое пространство решений и критерии верификации до создания среды, (2) явные параметры генерации для тонкой настройки сложности и топологии задач и (3) активный синтез учебных планов, адаптирующий распределение параметров по мере изменения способностей модели; авторы сообщают о генерации гимов разной сложности, в том числе сложных для передовых моделей в задачах продуктивности и временного рассуждения.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

MAWILE: рабочая платформа для аудита оценщиков LLM (arXiv v1)

Megagon Labs представила MAWILE — платформу для разработчиков (arXiv:2609.22599v1), которая проверяет чувствительность оценщиков LLM по четырём поверхностям — подсказка оценщика, рубрика, вход системы и выход системы — путём создания управляемых возмущений и повторного запуска оценщика. MAWILE поддерживает бинарные, порядковые и попарные оценщики без необходимости в эталонных метках; код выложен на GitHub.

6.0