Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · RESEARCH · #244

REFACTOR-VLA: Ненаблюдаемое обучение библиотеки типизированных моторных программ

В статье предлагается REFACTOR-VLA — ненаблюдаемое решение для обучения библиотеки типизированных моторных программ с целью модульности моделей «видение–язык–действие» (VLA). Авторы описывают современные VLA-модели (например, OpenVLA, π0, RT-2, RDT-1B) как «монолитные», генерирующие сырые команды или короткие последовательности действий, что, по их мнению, ограничивает выполнение многошаговых задач и интерпретируемость; также критикуется предыдущая работа по выделению навыков за то, что она не решает проблему «поведенческой эквивалентности» последовательностей действий.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье предлагается REFACTOR-VLA — ненаблюдаемое решение для обучения библиотеки типизированных моторных программ с целью модульности моделей «видение–язык–действие» (VLA).
  2. Авторы описывают современные VLA-модели (например, OpenVLA, π0, RT-2, RDT-1B) как «монолитные», генерирующие сырые команды или короткие последовательности действий, что, по их мнению, ограничивает выполнение многошаговых задач и интерпретируемость; также критикуется предыдущая работа по выделению навыков за то, что она не решает проблему «поведенческой эквивалентности» последовательностей действий.
  3. В случае успеха обучение переиспользуемых, типизированных моторных примитивов может повысить эффективность в многозадачных сценариях, интерпретируемость и переиспользование в VLA-системах.

ПОЧЕМУ ЭТО ВАЖНО

В случае успеха обучение переиспользуемых, типизированных моторных примитивов может повысить эффективность в многозадачных сценариях, интерпретируемость и переиспользование в VLA-системах.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1