Tech Meridian ← К ЛЕНТЕ
EN

ИССЛЕДОВАНИЕ · RESEARCH · #588

When2Think: Управление длиной рассуждения с учётом сложности (arXiv:2609.19671v1)

When2Think — это пост-тренировочная методика для гибридных моделей рассуждения, которая адаптивно распределяет ресурсы с помощью Instance-level Difficulty-Aware Control (IDAC): механизма формирования вознаграждения, использующего заранее вычисленную статистику и верификаторы для решения, отвечать ли сразу или продолжать многошаговое рассуждение. На математических бенчмарках авторы сообщают об улучшении эффективности — например, на AIME24 Pass@3 вырос на 10,0% при снижении числа токенов на 27,9% по сравнению с базовой моделью, а на AIME25 When2Think достигает 40,0% Pass@3 и превосходит методы сжатия и только маршрутизацией.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. When2Think — это пост-тренировочная методика для гибридных моделей рассуждения, которая адаптивно распределяет ресурсы с помощью Instance-level Difficulty-Aware Control (IDAC): механизма формирования вознаграждения, использующего заранее вычисленную статистику и верификаторы для решения, отвечать ли сразу или продолжать многошаговое рассуждение.
  2. На математических бенчмарках авторы сообщают об улучшении эффективности — например, на AIME24 Pass@3 вырос на 10,0% при снижении числа токенов на 27,9% по сравнению с базовой моделью, а на AIME25 When2Think достигает 40,0% Pass@3 и превосходит методы сжатия и только маршрутизацией.
  3. Такой подход к адаптивному распределению вычислений по сложности задач обещает улучшить компромисс между точностью и затратами вычислений в крупных моделях рассуждения.

ПОЧЕМУ ЭТО ВАЖНО

Такой подход к адаптивному распределению вычислений по сложности задач обещает улучшить компромисс между точностью и затратами вычислений в крупных моделях рассуждения.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1