ИССЛЕДОВАНИЕ · RESEARCH · #1635
AMBER: база «только-добавление» памяти для веб-агентов с долгими задачами
Статья (arXiv:2610.07118v1) представляет AMBER — систему «только-добавление» памяти, в которую агент совместно учится записывать сведения при выполнении рассуждений и действий, при этом правило только-добавления обеспечивает сохранность записей. Обучённый напрямую через reinforcement learning (без обширного SFT), AMBER повышает средний успех на WebArena Lite на 4.09 процентных пункта, увеличивает долю решённых задач при пяти повторных запусках на 4.8 процентных пункта и сравним с overwrite‑baseline, обученным на более дорогой кураторской разметке, при сохранении практичного токен‑бюджета.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья (arXiv:2610.07118v1) представляет AMBER — систему «только-добавление» памяти, в которую агент совместно учится записывать сведения при выполнении рассуждений и действий, при этом правило только-добавления обеспечивает сохранность записей.
- Обучённый напрямую через reinforcement learning (без обширного SFT), AMBER повышает средний успех на WebArena Lite на 4.09 процентных пункта, увеличивает долю решённых задач при пяти повторных запусках на 4.8 процентных пункта и сравним с overwrite‑baseline, обученным на более дорогой кураторской разметке, при сохранении практичного токен‑бюджета.
- Политика только-добавления предотвращает удаление важных фактов и корректирующей обратной связи, что повышает надёжность долгосрочных интерактивных агентов без дорогой супервизии.
ПОЧЕМУ ЭТО ВАЖНО
Политика только-добавления предотвращает удаление важных фактов и корректирующей обратной связи, что повышает надёжность долгосрочных интерактивных агентов без дорогой супервизии.