Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1487

Исследователи Google предлагают RRSI, чтобы агенты не запоминали тесты

Исследователи Google Cloud AI Research совместно с вузами предложили RRSI (Regularized Recursive Self-Improvement) — подход, который ограничивает автоматические правки «harness», чтобы агенты не переобучались на тестах. При замороженной модели Claude Opus 4.8 на восьми бенчмарках (включая JobBench и ARC-AGI-3) RRSI дал до +14,1 пункта на тренировочных задачах, до +4,7 пункта на невидимых тестах и сократил потребление токенов примерно на 30%; код опубликован на GitHub.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Исследователи Google Cloud AI Research совместно с вузами предложили RRSI (Regularized Recursive Self-Improvement) — подход, который ограничивает автоматические правки «harness», чтобы агенты не переобучались на тестах.
  2. При замороженной модели Claude Opus 4.8 на восьми бенчмарках (включая JobBench и ARC-AGI-3) RRSI дал до +14,1 пункта на тренировочных задачах, до +4,7 пункта на невидимых тестах и сократил потребление токенов примерно на 30%; код опубликован на GitHub.
  3. Ограничение самосовершенствования уменьшает запоминание бенчмарков и улучшает обобщение и эффективность оптимизации harness, что решает важную проблему автоматического рекурсивного тюнинга.

ПОЧЕМУ ЭТО ВАЖНО

Ограничение самосовершенствования уменьшает запоминание бенчмарков и улучшает обобщение и эффективность оптимизации harness, что решает важную проблему автоматического рекурсивного тюнинга.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1