Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #7777

ScienceWorld

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

SAGA: абстрагирование знаний на основе опыта для самоэволюционирующих LLM-агентов (arXiv:2610.06964v1)

В работе представлен SAGA — фреймворк, который последовательно переводит траектории взаимодействий LLM-агента в иерархическую память (эпизодические описания, повторно используемые процедуры и принципы с условиями применимости), связанные с доказательной информацией исполнения. Извлекаемые принципы инстанцируются в задачно-специфические указания для уточнения действий, создавая петлю обратной связи и улучшая результаты на бенчмарках ScienceWorld и ALFWorld; абляции подчёркивают важность контекстной инстанциации и регулирования действий.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

RLDS: разложение вознаграждения по подтаскам улучшает RL для агентов на языковых моделях (arXiv:2609.27035v1)

В работе предлагается Reinforcement Learning with Decomposed Subtasks (RLDS) и Subtask-Decomposed Advantage Estimation (SDAE): вместо сворачивания траекторного вознаграждения в одно скалярное значение они распределяют его по подтаскам перед обновлением политики. На четырёх бенчмарках метод давал значительные улучшения при высокой неоднородности подтасков (ScienceWorld +11.5 пунктов, paired-bootstrap 95% CI [+9.8, +13.3]; FrozenLake +9.8 пунктов, CI [+7.0, +12.8]), почти не менял результаты там, где диагностика предсказывала мало выиграть (HotpotQA, DeepResearch), и был эффективнее по времени на ScienceWorld (-10.9% wall-clock на шаг).

7.0