ИССЛЕДОВАНИЕ · RESEARCH · #611
Чего мы ожидаем от LLM? Картирование дизайна бенчмарков LLM (arXiv:2609.19182v1)
В статье проанализированы 14 767 материалов с arXiv, представлявших или обновлявших ресурсы оценки для LLM с января 2022 по август 2026 года, с использованием пошагового отбора и автоматизированного кодирования полного текста. Авторы отмечают усиление фокуса на действиях, взаимодействии и профессиональных приложениях, рост использования оценки на основе LLM в оценках для агентов и неагентов и отсутствие сопоставимого устойчивого роста материалов, сгенерированных моделями.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье проанализированы 14 767 материалов с arXiv, представлявших или обновлявших ресурсы оценки для LLM с января 2022 по август 2026 года, с использованием пошагового отбора и автоматизированного кодирования полного текста.
- Авторы отмечают усиление фокуса на действиях, взаимодействии и профессиональных приложениях, рост использования оценки на основе LLM в оценках для агентов и неагентов и отсутствие сопоставимого устойчивого роста материалов, сгенерированных моделями.
- Документируя сдвиги в дизайне бенчмарков, исследование показывает, как ожидания и практики оценки совместно развиваются с возможностями LLM и подчёркивает риск воспроизведения оценками предвзятостей, привнесённых моделями.
ПОЧЕМУ ЭТО ВАЖНО
Документируя сдвиги в дизайне бенчмарков, исследование показывает, как ожидания и практики оценки совместно развиваются с возможностями LLM и подчёркивает риск воспроизведения оценками предвзятостей, привнесённых моделями.