Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1336

Предмет на arXiv: агент редактирует собственный harness через многозадачную самоэволюцию

Статья (arXiv:2609.38372v1) предлагает схему, в которой тот же зафиксированный языковой модельный агент сначала решает задачи, а затем в роли предложителя читает полные записи прогонов и напрямую редактирует harness, который его запускает; эволюция использует задачи из пяти разных бенчмарков с разделением на обучающую и отложенную выборки и дополнительно проверяется на пяти внераспределённых бенчмарках. Начиная с 49-строчного исходного harness и применяя многозадачную предобучение и непрерывную дообучение, эволюционировавший harness повысил средние результаты на 4.48 пункта внутри распределения и на 12.64 пункта вне распределения, превзойдя Codex внутри распределения и сравнявшись с ним вне; дальнейшая эволюция по Claw-Eval подняла этот бенчмарк с 66.17 до 68.06, превысив Codex; в статье проанализированы возникшие механизмы (усечение вывода, сжатие истории, независимый обзор).

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Статья (arXiv:2609.38372v1) предлагает схему, в которой тот же зафиксированный языковой модельный агент сначала решает задачи, а затем в роли предложителя читает полные записи прогонов и напрямую редактирует harness, который его запускает; эволюция использует задачи из пяти разных бенчмарков с разделением на обучающую и отложенную выборки и дополнительно проверяется на пяти внераспределённых бенчмарках.
  2. Начиная с 49-строчного исходного harness и применяя многозадачную предобучение и непрерывную дообучение, эволюционировавший harness повысил средние результаты на 4.48 пункта внутри распределения и на 12.64 пункта вне распределения, превзойдя Codex внутри распределения и сравнявшись с ним вне; дальнейшая эволюция по Claw-Eval подняла этот бенчмарк с 66.17 до 68.06, превысив Codex; в статье проанализированы возникшие механизмы (усечение вывода, сжатие истории, независимый обзор).
  3. Показывает жизнеспособный путь для агентов автономно улучшать собственный исполняющий код в разных задачах, продвигая исследования рекурсивной самоулучшения и устойчивости агентов.

ПОЧЕМУ ЭТО ВАЖНО

Показывает жизнеспособный путь для агентов автономно улучшать собственный исполняющий код в разных задачах, продвигая исследования рекурсивной самоулучшения и устойчивости агентов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1