Tech Meridian ← К ЛЕНТЕ
EN

ИССЛЕДОВАНИЕ · RESEARCH · #597

SIFT — рекурсивное самоулучшение через быстрый древовидный поиск (arXiv:2609.19526v1)

В работе представлен SIFT — экономичный по выборкам фреймворк самоулучшения для агентов-программистов, который использует LLM в роли судьи для попарных сравнений кандидатов на изменение кода. Оценки судьи агрегируются регуляризованной моделью Брэдли–Терри и направляют лёгкий разобщённый древовидный поиск, а дорогие проверки на задачах выполняются только для наиболее перспективных ветвей; авторы сообщают о превосходстве подхода над предыдущими методами на полном бенчмарке Polyglot при значительно меньших затратах ресурсов.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В работе представлен SIFT — экономичный по выборкам фреймворк самоулучшения для агентов-программистов, который использует LLM в роли судьи для попарных сравнений кандидатов на изменение кода.
  2. Оценки судьи агрегируются регуляризованной моделью Брэдли–Терри и направляют лёгкий разобщённый древовидный поиск, а дорогие проверки на задачах выполняются только для наиболее перспективных ветвей; авторы сообщают о превосходстве подхода над предыдущими методами на полном бенчмарке Polyglot при значительно меньших затратах ресурсов.
  3. Если результаты подтвердятся, SIFT может сделать рекурсивное самоизменение агентов-программистов более практичным с точки зрения вычислений и затрат, используя оценки LLM для фокусировки дорогих проверок.

ПОЧЕМУ ЭТО ВАЖНО

Если результаты подтвердятся, SIFT может сделать рекурсивное самоизменение агентов-программистов более практичным с точки зрения вычислений и затрат, используя оценки LLM для фокусировки дорогих проверок.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1