Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1255

Представления и размер цепочки рассогласуются при адвёрсариальном обучении (arXiv:2609.35890v1)

В новой работе на arXiv авторы с помощью адвёрсариального непрерывного обучения, начиная с той же контрольной точки GPT-2 Small, проверяют, предсказывает ли простота представлений/атрибуции (через разложимость SAE и вовлечение SAE-фич) меньшую причинную схему при фиксированном уровне правдоподобия. Результаты: робастные модели более SAE-разложимы и задействуют меньше SAE-фич в объяснении задачи, тогда как размер цепочки зависит от порога правдоподобия — стандартные модели лидируют или вравниваются ниже ~85% правдоподобия, но робастные требуют существенно меньше ребер при высоком правдоподобии (90%, 95%); тенденции проверены на линейном обзоре и втором корпусе.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В новой работе на arXiv авторы с помощью адвёрсариального непрерывного обучения, начиная с той же контрольной точки GPT-2 Small, проверяют, предсказывает ли простота представлений/атрибуции (через разложимость SAE и вовлечение SAE-фич) меньшую причинную схему при фиксированном уровне правдоподобия.
  2. Результаты: робастные модели более SAE-разложимы и задействуют меньше SAE-фич в объяснении задачи, тогда как размер цепочки зависит от порога правдоподобия — стандартные модели лидируют или вравниваются ниже ~85% правдоподобия, но робастные требуют существенно меньше ребер при высоком правдоподобии (90%, 95%); тенденции проверены на линейном обзоре и втором корпусе.
  3. Важно, потому что это первый контролируемый эмпирический тест связи между простотой представлений/атрибуции и размером причинной схемы, что ставит под вопрос допущения в механистической интерпретируемости и оценке робастности.

ПОЧЕМУ ЭТО ВАЖНО

Важно, потому что это первый контролируемый эмпирический тест связи между простотой представлений/атрибуции и размером причинной схемы, что ставит под вопрос допущения в механистической интерпретируемости и оценке робастности.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1