Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1515

Статья DeReAct: модульные Critic и Context Manager для более надежных агентов в стиле ReAct

В препринте на arXiv представлена архитектура DeReAct, которая выносит две политики контроля — Critic для проверки предлагаемых действий и Context Manager для восстановления состояния, подтверждаемого окружением, и сертификации завершения задач. На наборах GAIA и SWE-bench Verified DeReAct повышает Pass@1 преимущественно для слабых «Brain»-моделей (на 6.5–7.0 пункта для Qwen3-Coder-480B, 4.2–5.2 для Claude Sonnet 4.5); прирост уменьшается по мере роста возможностей модели, а с Claude Opus 4.5 Pass@1 сопоставим с ReAct, но траектории лучше подкреплены доказательствами и соблюдают ограничения.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В препринте на arXiv представлена архитектура DeReAct, которая выносит две политики контроля — Critic для проверки предлагаемых действий и Context Manager для восстановления состояния, подтверждаемого окружением, и сертификации завершения задач.
  2. На наборах GAIA и SWE-bench Verified DeReAct повышает Pass@1 преимущественно для слабых «Brain»-моделей (на 6.5–7.0 пункта для Qwen3-Coder-480B, 4.2–5.2 для Claude Sonnet 4.5); прирост уменьшается по мере роста возможностей модели, а с Claude Opus 4.5 Pass@1 сопоставим с ReAct, но траектории лучше подкреплены доказательствами и соблюдают ограничения.
  3. Вынесение проверок действий и завершения задач снижает количество необоснованных утверждений о завершении и повышает надежность, особенно для слабых моделей, делая поведение агентов более контролируемым и обоснованным.

ПОЧЕМУ ЭТО ВАЖНО

Вынесение проверок действий и завершения задач снижает количество необоснованных утверждений о завершении и повышает надежность, особенно для слабых моделей, делая поведение агентов более контролируемым и обоснованным.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1