Tech Meridian ← К СУЩНОСТЯМ
EN

ТЕМА · ENTITY #1043

LLM benchmarks

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Чего мы ожидаем от LLM? Картирование дизайна бенчмарков LLM (arXiv:2609.19182v1)

В статье проанализированы 14 767 материалов с arXiv, представлявших или обновлявших ресурсы оценки для LLM с января 2022 по август 2026 года, с использованием пошагового отбора и автоматизированного кодирования полного текста. Авторы отмечают усиление фокуса на действиях, взаимодействии и профессиональных приложениях, рост использования оценки на основе LLM в оценках для агентов и неагентов и отсутствие сопоставимого устойчивого роста материалов, сгенерированных моделями.

7.0

RESEARCH · 1 ИСТОЧН. · Hugging Face

BenchMIRT: Что на самом деле измеряют бенчмарки LLM?

Hugging Face опубликовала материал «BenchMIRT: Что на самом деле измеряют бенчмарки LLM?», который, по всей видимости, рассматривает подход BenchMIRT и ставит под вопрос, что именно измеряют существующие бенчмарки LLM. Текст статьи в этой записи не приведён, поэтому конкретные выводы недоступны.

7.0