ИССЛЕДОВАНИЕ · RESEARCH · #1416
Исследование показывает, что фрагментная подстановка по PRM (PPFG) не даёт заметного эффекта на протестированных моделях рассуждения
Статья выделяет PRM-Pruned Fragment Grafting (PPFG) как минимальное вмешательство во время инференса и тестирует его на Qwen2.5-7B-Instruct с Math-Shepherd на MATH500 (с репликацией по трём базовым моделям, шести бенчмаркам, второму PRM и перебором ворот). PPFG — как при целевой подстановке стагнаций, так и при случайной — статистически не отличалась от независимого parallel-CoT; авторы объясняют инертность некорректной нацеливаемостью (только ≈14% инъекций попадали в действительно затрудняющиеся цепочки) и состояниями плато, которые подстановка не исправляет, и предлагают шаблон тестирования эквивалентности для нулевых эффектов.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья выделяет PRM-Pruned Fragment Grafting (PPFG) как минимальное вмешательство во время инференса и тестирует его на Qwen2.5-7B-Instruct с Math-Shepherd на MATH500 (с репликацией по трём базовым моделям, шести бенчмаркам, второму PRM и перебором ворот).
- PPFG — как при целевой подстановке стагнаций, так и при случайной — статистически не отличалась от независимого parallel-CoT; авторы объясняют инертность некорректной нацеливаемостью (только ≈14% инъекций попадали в действительно затрудняющиеся цепочки) и состояниями плато, которые подстановка не исправляет, и предлагают шаблон тестирования эквивалентности для нулевых эффектов.
- Это важно, потому что PPFG — дешёвый механизм для улучшения передачи шагов между треками в chain-of-thought, и доказанная инертность в протестированных условиях перенаправляет усилия и даёт строгий шаблон для опровержения подобных вмешательств.
ПОЧЕМУ ЭТО ВАЖНО
Это важно, потому что PPFG — дешёвый механизм для улучшения передачи шагов между треками в chain-of-thought, и доказанная инертность в протестированных условиях перенаправляет усилия и даёт строгий шаблон для опровержения подобных вмешательств.