Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1242

InfoNCE выявляет эффективные уровни для VLA-политик (arXiv:2609.36118v1)

В препринте на arXiv исследуется, какие слои предварительно обученных vision-language-бэкбонов следует открывать для action-head в VLA-политиках. По трем моделям, двум бенчмаркам (LIBERO, CALVIN) и 54 вариантам слоёв/фьюзинга авторы показывают, что большинство стратегий фьюзинга уступают лучшему однослойному решению, а InfoNCE-метрика лучше всего коррелирует с успешностью политики и позволяет выбирать слой с в 9–33 раза меньшей вычислительной затратой и снизить среднее сожаление выбора с 17.89 до 3.71 процентных пункта.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В препринте на arXiv исследуется, какие слои предварительно обученных vision-language-бэкбонов следует открывать для action-head в VLA-политиках.
  2. По трем моделям, двум бенчмаркам (LIBERO, CALVIN) и 54 вариантам слоёв/фьюзинга авторы показывают, что большинство стратегий фьюзинга уступают лучшему однослойному решению, а InfoNCE-метрика лучше всего коррелирует с успешностью политики и позволяет выбирать слой с в 9–33 раза меньшей вычислительной затратой и снизить среднее сожаление выбора с 17.89 до 3.71 процентных пункта.
  3. Это важно, потому что InfoNCE даёт дешёвый и практичный критерий для выбора слоёв бэкбона в VLA-политиках, снижая вычислительные затраты и необходимость исчерпывающего перебора.

ПОЧЕМУ ЭТО ВАЖНО

Это важно, потому что InfoNCE даёт дешёвый и практичный критерий для выбора слоёв бэкбона в VLA-политиках, снижая вычислительные затраты и необходимость исчерпывающего перебора.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1