ИССЛЕДОВАНИЕ · RESEARCH · #1251
SAGE: статистический пропускной критерий снижает регрессии в саморедактирующихся агентах на базе LLM
Новая работа в arXiv (arXiv:2609.36043v1) предлагает SAGE — статистический критерий принятия правок для саморедактирующихся агентов на базе LLM, который (1) использует покомпонентные парные сравнения для выявления регрессий, скрываемых агрегатными метриками, и (2) применяет односторонний парный статистический тест, принимая правку только при статистически надёжных выигрышах. По пяти бенчмаркам и четырём базовым LLM в равных ресурсных условиях SAGE существенно снижает долю регрессий в 19 из 20 настроек и улучшает или сохраняет итоговые показатели (например, регрессии с 36,5% до 0% на LiveMath и с 42,8% до 0% на OfficeQA с DeepSeek‑V4).
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Новая работа в arXiv (arXiv:2609.36043v1) предлагает SAGE — статистический критерий принятия правок для саморедактирующихся агентов на базе LLM, который (1) использует покомпонентные парные сравнения для выявления регрессий, скрываемых агрегатными метриками, и (2) применяет односторонний парный статистический тест, принимая правку только при статистически надёжных выигрышах.
- По пяти бенчмаркам и четырём базовым LLM в равных ресурсных условиях SAGE существенно снижает долю регрессий в 19 из 20 настроек и улучшает или сохраняет итоговые показатели (например, регрессии с 36,5% до 0% на LiveMath и с 42,8% до 0% на OfficeQA с DeepSeek‑V4).
- Предотвращает постоянные регрессии и смягчает эффект «оптимизаторского проклятия» в саморедактирующихся агентах, тестируя правки по элементам и требуя статистически надёжных выигрышей, что повышает надёжность автономных обновлений моделей.
ПОЧЕМУ ЭТО ВАЖНО
Предотвращает постоянные регрессии и смягчает эффект «оптимизаторского проклятия» в саморедактирующихся агентах, тестируя правки по элементам и требуя статистически надёжных выигрышей, что повышает надёжность автономных обновлений моделей.