ИССЛЕДОВАНИЕ · RESEARCH · #937
Интервенции на уровне активаций показывают, что большая часть указанных шагов логики влияет на ответ в Qwen3-4B
В препринте предложен каузальный тест на уровне активаций: авторы патчат residual stream на токенах, где модель формулирует промежуточные шаги, подставляя активации из контрфактического прогона в синтетических заданиях с 2–6 переходами. Для Qwen3-4B 76,9% ± 2,8% указанных шагов оказываются каузально значимыми на наиболее отзывчивом среднем слое (случайный контроль 11,3%; патч факта из подсказки даёт 83%), тогда как стандартный поведенческий тест даёт 88,2% и переоценивает каузальную верность примерно на 11,4 процентных пункта; у Qwen3-1.7B каузальная верность заметно ниже (54,8%) и падает с глубиной рассуждения (68% при 2 переходах до 30% при 6).
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В препринте предложен каузальный тест на уровне активаций: авторы патчат residual stream на токенах, где модель формулирует промежуточные шаги, подставляя активации из контрфактического прогона в синтетических заданиях с 2–6 переходами.
- Для Qwen3-4B 76,9% ± 2,8% указанных шагов оказываются каузально значимыми на наиболее отзывчивом среднем слое (случайный контроль 11,3%; патч факта из подсказки даёт 83%), тогда как стандартный поведенческий тест даёт 88,2% и переоценивает каузальную верность примерно на 11,4 процентных пункта; у Qwen3-1.7B каузальная верность заметно ниже (54,8%) и падает с глубиной рассуждения (68% при 2 переходах до 30% при 6).
- Работа показывает, что записанные моделью рассуждения могут быть каузально значимы на уровне активаций, но привычные поведенческие тесты систематически переоценивают это — важно для оценки и интерпретации рассуждений больших моделей.
ПОЧЕМУ ЭТО ВАЖНО
Работа показывает, что записанные моделью рассуждения могут быть каузально значимы на уровне активаций, но привычные поведенческие тесты систематически переоценивают это — важно для оценки и интерпретации рассуждений больших моделей.