Представления и размер цепочки рассогласуются при адвёрсариальном обучении (arXiv:2609.35890v1)
В новой работе на arXiv авторы с помощью адвёрсариального непрерывного обучения, начиная с той же контрольной точки GPT-2 Small, проверяют, предсказывает ли простота представлений/атрибуции (через разложимость SAE и вовлечение SAE-фич) меньшую причинную схему при фиксированном уровне правдоподобия. Результаты: робастные модели более SAE-разложимы и задействуют меньше SAE-фич в объяснении задачи, тогда как размер цепочки зависит от порога правдоподобия — стандартные модели лидируют или вравниваются ниже ~85% правдоподобия, но робастные требуют существенно меньше ребер при высоком правдоподобии (90%, 95%); тенденции проверены на линейном обзоре и втором корпусе.