НОВОСТЬ · RESEARCH · #244
REFACTOR-VLA: Ненаблюдаемое обучение библиотеки типизированных моторных программ
В статье предлагается REFACTOR-VLA — ненаблюдаемое решение для обучения библиотеки типизированных моторных программ с целью модульности моделей «видение–язык–действие» (VLA). Авторы описывают современные VLA-модели (например, OpenVLA, π0, RT-2, RDT-1B) как «монолитные», генерирующие сырые команды или короткие последовательности действий, что, по их мнению, ограничивает выполнение многошаговых задач и интерпретируемость; также критикуется предыдущая работа по выделению навыков за то, что она не решает проблему «поведенческой эквивалентности» последовательностей действий.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье предлагается REFACTOR-VLA — ненаблюдаемое решение для обучения библиотеки типизированных моторных программ с целью модульности моделей «видение–язык–действие» (VLA).
- Авторы описывают современные VLA-модели (например, OpenVLA, π0, RT-2, RDT-1B) как «монолитные», генерирующие сырые команды или короткие последовательности действий, что, по их мнению, ограничивает выполнение многошаговых задач и интерпретируемость; также критикуется предыдущая работа по выделению навыков за то, что она не решает проблему «поведенческой эквивалентности» последовательностей действий.
- В случае успеха обучение переиспользуемых, типизированных моторных примитивов может повысить эффективность в многозадачных сценариях, интерпретируемость и переиспользование в VLA-системах.
ПОЧЕМУ ЭТО ВАЖНО
В случае успеха обучение переиспользуемых, типизированных моторных примитивов может повысить эффективность в многозадачных сценариях, интерпретируемость и переиспользование в VLA-системах.