ИССЛЕДОВАНИЕ · RESEARCH · #1326
NAQD-Env: бенчмарк для селективного прерывания в языковых агентах
Статья (arXiv:2609.38460v1) представляет NAQD-Env — синтетический детерминированный бенчмарк для оценки решений языковых агентов о приостановке, сохранении и возобновлении действий по 11 семействам зависимостей и явным входным данным о доказательствах/разрешениях. Оценка трёх открытых моделей (Qwen2.5-7B, Qwen2.5-3B, Llama-3.1-8B) в трёх условиях подсказки на 350 сценариях (3 150 эпизодов) показала очень низкую полноту отзыва (≤0,06), отсутствие корректных возобновлений и лишь один эпизод, полностью совпавший с эталонной политикой; дообучение повысило точность решений Qwen2.5-3B, но привело к другим проблемам.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья (arXiv:2609.38460v1) представляет NAQD-Env — синтетический детерминированный бенчмарк для оценки решений языковых агентов о приостановке, сохранении и возобновлении действий по 11 семействам зависимостей и явным входным данным о доказательствах/разрешениях.
- Оценка трёх открытых моделей (Qwen2.5-7B, Qwen2.5-3B, Llama-3.1-8B) в трёх условиях подсказки на 350 сценариях (3 150 эпизодов) показала очень низкую полноту отзыва (≤0,06), отсутствие корректных возобновлений и лишь один эпизод, полностью совпавший с эталонной политикой; дообучение повысило точность решений Qwen2.5-3B, но привело к другим проблемам.
- Селективное прерывание — отдельный компонент надёжности агентов; NAQD-Env выявляет системные провалы (очень низкие показатели отзыва/возобновления), важные для безопасного поведения и оценки агентов.
ПОЧЕМУ ЭТО ВАЖНО
Селективное прерывание — отдельный компонент надёжности агентов; NAQD-Env выявляет системные провалы (очень низкие показатели отзыва/возобновления), важные для безопасного поведения и оценки агентов.