ИССЛЕДОВАНИЕ · RESEARCH · #1487
Исследователи Google предлагают RRSI, чтобы агенты не запоминали тесты
Исследователи Google Cloud AI Research совместно с вузами предложили RRSI (Regularized Recursive Self-Improvement) — подход, который ограничивает автоматические правки «harness», чтобы агенты не переобучались на тестах. При замороженной модели Claude Opus 4.8 на восьми бенчмарках (включая JobBench и ARC-AGI-3) RRSI дал до +14,1 пункта на тренировочных задачах, до +4,7 пункта на невидимых тестах и сократил потребление токенов примерно на 30%; код опубликован на GitHub.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Исследователи Google Cloud AI Research совместно с вузами предложили RRSI (Regularized Recursive Self-Improvement) — подход, который ограничивает автоматические правки «harness», чтобы агенты не переобучались на тестах.
- При замороженной модели Claude Opus 4.8 на восьми бенчмарках (включая JobBench и ARC-AGI-3) RRSI дал до +14,1 пункта на тренировочных задачах, до +4,7 пункта на невидимых тестах и сократил потребление токенов примерно на 30%; код опубликован на GitHub.
- Ограничение самосовершенствования уменьшает запоминание бенчмарков и улучшает обобщение и эффективность оптимизации harness, что решает важную проблему автоматического рекурсивного тюнинга.
ПОЧЕМУ ЭТО ВАЖНО
Ограничение самосовершенствования уменьшает запоминание бенчмарков и улучшает обобщение и эффективность оптимизации harness, что решает важную проблему автоматического рекурсивного тюнинга.