Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #937

Интервенции на уровне активаций показывают, что большая часть указанных шагов логики влияет на ответ в Qwen3-4B

В препринте предложен каузальный тест на уровне активаций: авторы патчат residual stream на токенах, где модель формулирует промежуточные шаги, подставляя активации из контрфактического прогона в синтетических заданиях с 2–6 переходами. Для Qwen3-4B 76,9% ± 2,8% указанных шагов оказываются каузально значимыми на наиболее отзывчивом среднем слое (случайный контроль 11,3%; патч факта из подсказки даёт 83%), тогда как стандартный поведенческий тест даёт 88,2% и переоценивает каузальную верность примерно на 11,4 процентных пункта; у Qwen3-1.7B каузальная верность заметно ниже (54,8%) и падает с глубиной рассуждения (68% при 2 переходах до 30% при 6).

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В препринте предложен каузальный тест на уровне активаций: авторы патчат residual stream на токенах, где модель формулирует промежуточные шаги, подставляя активации из контрфактического прогона в синтетических заданиях с 2–6 переходами.
  2. Для Qwen3-4B 76,9% ± 2,8% указанных шагов оказываются каузально значимыми на наиболее отзывчивом среднем слое (случайный контроль 11,3%; патч факта из подсказки даёт 83%), тогда как стандартный поведенческий тест даёт 88,2% и переоценивает каузальную верность примерно на 11,4 процентных пункта; у Qwen3-1.7B каузальная верность заметно ниже (54,8%) и падает с глубиной рассуждения (68% при 2 переходах до 30% при 6).
  3. Работа показывает, что записанные моделью рассуждения могут быть каузально значимы на уровне активаций, но привычные поведенческие тесты систематически переоценивают это — важно для оценки и интерпретации рассуждений больших моделей.

ПОЧЕМУ ЭТО ВАЖНО

Работа показывает, что записанные моделью рассуждения могут быть каузально значимы на уровне активаций, но привычные поведенческие тесты систематически переоценивают это — важно для оценки и интерпретации рассуждений больших моделей.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1