ИССЛЕДОВАНИЕ · RESEARCH · #1398
Бенчмарк автоматической оптимизации подсказок на шахматах (arXiv:2610.00416v1)
В работе предложен бенчмарк на основе 1 118 задач с Lichess для оценки автоматической оптимизации подсказок (APO) на «замороженных» LLM: точная проверка совпадений, оценка ходов шахматным движком, возможность обновления задач и низкая стоимость (исследование обошлось примерно в $800). Авторы протестировали шесть алгоритмов APO на восьми моделях (Gemini 3.5 Flash решает около 55% задач) и опубликовали задачи, код и скрипты на GitHub.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В работе предложен бенчмарк на основе 1 118 задач с Lichess для оценки автоматической оптимизации подсказок (APO) на «замороженных» LLM: точная проверка совпадений, оценка ходов шахматным движком, возможность обновления задач и низкая стоимость (исследование обошлось примерно в $800).
- Авторы протестировали шесть алгоритмов APO на восьми моделях (Gemini 3.5 Flash решает около 55% задач) и опубликовали задачи, код и скрипты на GitHub.
- Предоставляет дешёвый, детерминированный и обновляемый бенчмарк, подходящий для многократной оценки APO и снижения проблем с загрязнением и насыщением тестов.
ПОЧЕМУ ЭТО ВАЖНО
Предоставляет дешёвый, детерминированный и обновляемый бенчмарк, подходящий для многократной оценки APO и снижения проблем с загрязнением и насыщением тестов.