ИССЛЕДОВАНИЕ · RESEARCH · #1255
Представления и размер цепочки рассогласуются при адвёрсариальном обучении (arXiv:2609.35890v1)
В новой работе на arXiv авторы с помощью адвёрсариального непрерывного обучения, начиная с той же контрольной точки GPT-2 Small, проверяют, предсказывает ли простота представлений/атрибуции (через разложимость SAE и вовлечение SAE-фич) меньшую причинную схему при фиксированном уровне правдоподобия. Результаты: робастные модели более SAE-разложимы и задействуют меньше SAE-фич в объяснении задачи, тогда как размер цепочки зависит от порога правдоподобия — стандартные модели лидируют или вравниваются ниже ~85% правдоподобия, но робастные требуют существенно меньше ребер при высоком правдоподобии (90%, 95%); тенденции проверены на линейном обзоре и втором корпусе.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В новой работе на arXiv авторы с помощью адвёрсариального непрерывного обучения, начиная с той же контрольной точки GPT-2 Small, проверяют, предсказывает ли простота представлений/атрибуции (через разложимость SAE и вовлечение SAE-фич) меньшую причинную схему при фиксированном уровне правдоподобия.
- Результаты: робастные модели более SAE-разложимы и задействуют меньше SAE-фич в объяснении задачи, тогда как размер цепочки зависит от порога правдоподобия — стандартные модели лидируют или вравниваются ниже ~85% правдоподобия, но робастные требуют существенно меньше ребер при высоком правдоподобии (90%, 95%); тенденции проверены на линейном обзоре и втором корпусе.
- Важно, потому что это первый контролируемый эмпирический тест связи между простотой представлений/атрибуции и размером причинной схемы, что ставит под вопрос допущения в механистической интерпретируемости и оценке робастности.
ПОЧЕМУ ЭТО ВАЖНО
Важно, потому что это первый контролируемый эмпирический тест связи между простотой представлений/атрибуции и размером причинной схемы, что ставит под вопрос допущения в механистической интерпретируемости и оценке робастности.