Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1398

Бенчмарк автоматической оптимизации подсказок на шахматах (arXiv:2610.00416v1)

В работе предложен бенчмарк на основе 1 118 задач с Lichess для оценки автоматической оптимизации подсказок (APO) на «замороженных» LLM: точная проверка совпадений, оценка ходов шахматным движком, возможность обновления задач и низкая стоимость (исследование обошлось примерно в $800). Авторы протестировали шесть алгоритмов APO на восьми моделях (Gemini 3.5 Flash решает около 55% задач) и опубликовали задачи, код и скрипты на GitHub.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В работе предложен бенчмарк на основе 1 118 задач с Lichess для оценки автоматической оптимизации подсказок (APO) на «замороженных» LLM: точная проверка совпадений, оценка ходов шахматным движком, возможность обновления задач и низкая стоимость (исследование обошлось примерно в $800).
  2. Авторы протестировали шесть алгоритмов APO на восьми моделях (Gemini 3.5 Flash решает около 55% задач) и опубликовали задачи, код и скрипты на GitHub.
  3. Предоставляет дешёвый, детерминированный и обновляемый бенчмарк, подходящий для многократной оценки APO и снижения проблем с загрязнением и насыщением тестов.

ПОЧЕМУ ЭТО ВАЖНО

Предоставляет дешёвый, детерминированный и обновляемый бенчмарк, подходящий для многократной оценки APO и снижения проблем с загрязнением и насыщением тестов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1