Сим‑к‑реалу для Vision‑Language Navigation с Cross‑Modal Attention на роботе с рулевым управлением Ackermann (arXiv:2610.07192v1)
В препринте (v1) представлена система VLN для непрерывных сред без навигационных графов и панорамных обзоров: архитектура с Cross‑Modal Attention обучается в симуляции и дообучается на ограниченном наборе реальных эпизодов, собранных на самодельном роботе с рулевым управлением Ackermann, камерой и LiDAR. Применены линейные фотометрические корректировки, результаты оценены по SPL и nDTW; модель работает офлайн на выделённом железе.