ИССЛЕДОВАНИЕ · RESEARCH · #1499
Статья на arXiv сравнивает дообучение и RAG для LM‑моделей мира
Предпечатная версия на arXiv (arXiv:2610.02542v1) систематически сравнивает дообучение и Retrieval-Augmented Generation (RAG) для LM‑моделей мира в пяти различных текстовых средах (включая среды с телесностью, веб‑навигацию и социальные сценарии). Авторы сообщают, что дообученные WМ дают более высокие вознаграждения в 15 из 20 настроек, RAG оказывается более эффективным по данным; выявляют ошибки выборки из буфера опыта, показывают, что иерархическая реформулировка запросов улучшает поиск, и предлагают гибридную систему (параметрическая часть + поиск), которая превосходит прочие методы.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Предпечатная версия на arXiv (arXiv:2610.02542v1) систематически сравнивает дообучение и Retrieval-Augmented Generation (RAG) для LM‑моделей мира в пяти различных текстовых средах (включая среды с телесностью, веб‑навигацию и социальные сценарии).
- Авторы сообщают, что дообученные WМ дают более высокие вознаграждения в 15 из 20 настроек, RAG оказывается более эффективным по данным; выявляют ошибки выборки из буфера опыта, показывают, что иерархическая реформулировка запросов улучшает поиск, и предлагают гибридную систему (параметрическая часть + поиск), которая превосходит прочие методы.
- Это важно, поскольку проясняет компромиссы между дообучением и поиском для LM‑моделей мира — влияя на эффективность по данным, поведение при масштабировании и практические решения при проектировании планирующих агентов.
ПОЧЕМУ ЭТО ВАЖНО
Это важно, поскольку проясняет компромиссы между дообучением и поиском для LM‑моделей мира — влияя на эффективность по данным, поведение при масштабировании и практические решения при проектировании планирующих агентов.