Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1326

NAQD-Env: бенчмарк для селективного прерывания в языковых агентах

Статья (arXiv:2609.38460v1) представляет NAQD-Env — синтетический детерминированный бенчмарк для оценки решений языковых агентов о приостановке, сохранении и возобновлении действий по 11 семействам зависимостей и явным входным данным о доказательствах/разрешениях. Оценка трёх открытых моделей (Qwen2.5-7B, Qwen2.5-3B, Llama-3.1-8B) в трёх условиях подсказки на 350 сценариях (3 150 эпизодов) показала очень низкую полноту отзыва (≤0,06), отсутствие корректных возобновлений и лишь один эпизод, полностью совпавший с эталонной политикой; дообучение повысило точность решений Qwen2.5-3B, но привело к другим проблемам.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Статья (arXiv:2609.38460v1) представляет NAQD-Env — синтетический детерминированный бенчмарк для оценки решений языковых агентов о приостановке, сохранении и возобновлении действий по 11 семействам зависимостей и явным входным данным о доказательствах/разрешениях.
  2. Оценка трёх открытых моделей (Qwen2.5-7B, Qwen2.5-3B, Llama-3.1-8B) в трёх условиях подсказки на 350 сценариях (3 150 эпизодов) показала очень низкую полноту отзыва (≤0,06), отсутствие корректных возобновлений и лишь один эпизод, полностью совпавший с эталонной политикой; дообучение повысило точность решений Qwen2.5-3B, но привело к другим проблемам.
  3. Селективное прерывание — отдельный компонент надёжности агентов; NAQD-Env выявляет системные провалы (очень низкие показатели отзыва/возобновления), важные для безопасного поведения и оценки агентов.

ПОЧЕМУ ЭТО ВАЖНО

Селективное прерывание — отдельный компонент надёжности агентов; NAQD-Env выявляет системные провалы (очень низкие показатели отзыва/возобновления), важные для безопасного поведения и оценки агентов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1