ИССЛЕДОВАНИЕ · RESEARCH · #1652
Метонимические цепочки показывают, как Vision Transformer'ы усваивают абстрактные понятия
В статье на arXiv вводится понятие «метонимических цепочек»: промежуточных, более конкретных якорных концептов (например, «огонь»), которые связывают визуальные сигналы с абстрактными метками (например, «злой»). Применив Transcoders к энкодерам CLIP и DINO и проанализировав специализированный набор иконок, авторы восстанавливают структурированные цепочки, где перцептуальные примитивы доминируют в ранних слоях, объектоподобные якори предшествуют абстрактным целям, изображения с отрисованным текстом идут по отдельному пути «перцепция→текст», а причинные вмешательства подтверждают функциональную роль этих промежуточных представлений.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье на arXiv вводится понятие «метонимических цепочек»: промежуточных, более конкретных якорных концептов (например, «огонь»), которые связывают визуальные сигналы с абстрактными метками (например, «злой»).
- Применив Transcoders к энкодерам CLIP и DINO и проанализировав специализированный набор иконок, авторы восстанавливают структурированные цепочки, где перцептуальные примитивы доминируют в ранних слоях, объектоподобные якори предшествуют абстрактным целям, изображения с отрисованным текстом идут по отдельному пути «перцепция→текст», а причинные вмешательства подтверждают функциональную роль этих промежуточных представлений.
- Выявляет и причинно подтверждает промежуточные интерпретируемые представления, связывающие восприятие с абстрактной семантикой в визуальных моделях, что важно для интерпретируемости и дизайна наборов данных.
ПОЧЕМУ ЭТО ВАЖНО
Выявляет и причинно подтверждает промежуточные интерпретируемые представления, связывающие восприятие с абстрактной семантикой в визуальных моделях, что важно для интерпретируемости и дизайна наборов данных.