Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #10923

faithfulness thresholds (85%, 90%, 95%)

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Представления и размер цепочки рассогласуются при адвёрсариальном обучении (arXiv:2609.35890v1)

В новой работе на arXiv авторы с помощью адвёрсариального непрерывного обучения, начиная с той же контрольной точки GPT-2 Small, проверяют, предсказывает ли простота представлений/атрибуции (через разложимость SAE и вовлечение SAE-фич) меньшую причинную схему при фиксированном уровне правдоподобия. Результаты: робастные модели более SAE-разложимы и задействуют меньше SAE-фич в объяснении задачи, тогда как размер цепочки зависит от порога правдоподобия — стандартные модели лидируют или вравниваются ниже ~85% правдоподобия, но робастные требуют существенно меньше ребер при высоком правдоподобии (90%, 95%); тенденции проверены на линейном обзоре и втором корпусе.

7.0