Tech Meridian ← К ЛЕНТЕ
EN

ИССЛЕДОВАНИЕ · RESEARCH · #611

Чего мы ожидаем от LLM? Картирование дизайна бенчмарков LLM (arXiv:2609.19182v1)

В статье проанализированы 14 767 материалов с arXiv, представлявших или обновлявших ресурсы оценки для LLM с января 2022 по август 2026 года, с использованием пошагового отбора и автоматизированного кодирования полного текста. Авторы отмечают усиление фокуса на действиях, взаимодействии и профессиональных приложениях, рост использования оценки на основе LLM в оценках для агентов и неагентов и отсутствие сопоставимого устойчивого роста материалов, сгенерированных моделями.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье проанализированы 14 767 материалов с arXiv, представлявших или обновлявших ресурсы оценки для LLM с января 2022 по август 2026 года, с использованием пошагового отбора и автоматизированного кодирования полного текста.
  2. Авторы отмечают усиление фокуса на действиях, взаимодействии и профессиональных приложениях, рост использования оценки на основе LLM в оценках для агентов и неагентов и отсутствие сопоставимого устойчивого роста материалов, сгенерированных моделями.
  3. Документируя сдвиги в дизайне бенчмарков, исследование показывает, как ожидания и практики оценки совместно развиваются с возможностями LLM и подчёркивает риск воспроизведения оценками предвзятостей, привнесённых моделями.

ПОЧЕМУ ЭТО ВАЖНО

Документируя сдвиги в дизайне бенчмарков, исследование показывает, как ожидания и практики оценки совместно развиваются с возможностями LLM и подчёркивает риск воспроизведения оценками предвзятостей, привнесённых моделями.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1