Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1251

SAGE: статистический пропускной критерий снижает регрессии в саморедактирующихся агентах на базе LLM

Новая работа в arXiv (arXiv:2609.36043v1) предлагает SAGE — статистический критерий принятия правок для саморедактирующихся агентов на базе LLM, который (1) использует покомпонентные парные сравнения для выявления регрессий, скрываемых агрегатными метриками, и (2) применяет односторонний парный статистический тест, принимая правку только при статистически надёжных выигрышах. По пяти бенчмаркам и четырём базовым LLM в равных ресурсных условиях SAGE существенно снижает долю регрессий в 19 из 20 настроек и улучшает или сохраняет итоговые показатели (например, регрессии с 36,5% до 0% на LiveMath и с 42,8% до 0% на OfficeQA с DeepSeek‑V4).

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Новая работа в arXiv (arXiv:2609.36043v1) предлагает SAGE — статистический критерий принятия правок для саморедактирующихся агентов на базе LLM, который (1) использует покомпонентные парные сравнения для выявления регрессий, скрываемых агрегатными метриками, и (2) применяет односторонний парный статистический тест, принимая правку только при статистически надёжных выигрышах.
  2. По пяти бенчмаркам и четырём базовым LLM в равных ресурсных условиях SAGE существенно снижает долю регрессий в 19 из 20 настроек и улучшает или сохраняет итоговые показатели (например, регрессии с 36,5% до 0% на LiveMath и с 42,8% до 0% на OfficeQA с DeepSeek‑V4).
  3. Предотвращает постоянные регрессии и смягчает эффект «оптимизаторского проклятия» в саморедактирующихся агентах, тестируя правки по элементам и требуя статистически надёжных выигрышей, что повышает надёжность автономных обновлений моделей.

ПОЧЕМУ ЭТО ВАЖНО

Предотвращает постоянные регрессии и смягчает эффект «оптимизаторского проклятия» в саморедактирующихся агентах, тестируя правки по элементам и требуя статистически надёжных выигрышей, что повышает надёжность автономных обновлений моделей.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1