ИССЛЕДОВАНИЕ · RESEARCH · #936
Математические рассуждения в LLM организуются по подходу, а не по теме
Авторы (arXiv:2609.27041v1) представляют протокол generation-replay для извлечения подписей важности активаций по токенам рассуждений и кластеризации этих подписей для восьми открытых LLM и пяти наборов задач по математике. Результаты показывают, что кластеры соответствуют повторно используемым подходам к рассуждению (77–82% согласия судей на уровне подхода), а не темам бенчмарков; изменение запрошенного подхода сдвигает присвоение кластеров в 7 из 8 случаев, тогда как перефразирование в основном сохраняет их.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Авторы (arXiv:2609.27041v1) представляют протокол generation-replay для извлечения подписей важности активаций по токенам рассуждений и кластеризации этих подписей для восьми открытых LLM и пяти наборов задач по математике.
- Результаты показывают, что кластеры соответствуют повторно используемым подходам к рассуждению (77–82% согласия судей на уровне подхода), а не темам бенчмарков; изменение запрошенного подхода сдвигает присвоение кластеров в 7 из 8 случаев, тогда как перефразирование в основном сохраняет их.
- Если LLM внутренне организуют математические рассуждения по повторяемым подходам, а не по темам, то оценка и обучение, сбалансированные по темам, могут не заметить важные дисбалансы по подходам к рассуждению.
ПОЧЕМУ ЭТО ВАЖНО
Если LLM внутренне организуют математические рассуждения по повторяемым подходам, а не по темам, то оценка и обучение, сбалансированные по темам, могут не заметить важные дисбалансы по подходам к рассуждению.