ИССЛЕДОВАНИЕ · RESEARCH · #1633
Сим‑к‑реалу для Vision‑Language Navigation с Cross‑Modal Attention на роботе с рулевым управлением Ackermann (arXiv:2610.07192v1)
В препринте (v1) представлена система VLN для непрерывных сред без навигационных графов и панорамных обзоров: архитектура с Cross‑Modal Attention обучается в симуляции и дообучается на ограниченном наборе реальных эпизодов, собранных на самодельном роботе с рулевым управлением Ackermann, камерой и LiDAR. Применены линейные фотометрические корректировки, результаты оценены по SPL и nDTW; модель работает офлайн на выделённом железе.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В препринте (v1) представлена система VLN для непрерывных сред без навигационных графов и панорамных обзоров: архитектура с Cross‑Modal Attention обучается в симуляции и дообучается на ограниченном наборе реальных эпизодов, собранных на самодельном роботе с рулевым управлением Ackermann, камерой и LiDAR.
- Применены линейные фотометрические корректировки, результаты оценены по SPL и nDTW; модель работает офлайн на выделённом железе.
- Демонстрирует практический путь сим‑к‑реалу для VLN в непрерывных средах без панорамных видов, с минимальным набором реальных эпизодов и на платформе Ackermann — важно для внедрения навигации по естественному языку на реальных роботов.
ПОЧЕМУ ЭТО ВАЖНО
Демонстрирует практический путь сим‑к‑реалу для VLN в непрерывных средах без панорамных видов, с минимальным набором реальных эпизодов и на платформе Ackermann — важно для внедрения навигации по естественному языку на реальных роботов.