Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1684

Microsoft Research Asia опубликовала Agent Lightning v1.0 — лёгкий фреймворк Harnessed Agentic RL

Microsoft Research Asia выпустила Agent Lightning v1.0 — примерно 3 500 строк открытого кода, реализующего парадигму Harnessed Agentic RL, где для обучения используется тот же агентный «harness», что и в деплое, через прокси LLM. Фреймворк поддерживает запуск агентов как Kubernetes‑job’ы, исключает необходимость переработки harness’а для тренировки и включает пример обучения кодирующего агента, поднявшего Pass@1 Qwen3.5-9B на SWE-bench Verified с 41.8% до 56.4% на ~6 000 образцах.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Microsoft Research Asia выпустила Agent Lightning v1.0 — примерно 3 500 строк открытого кода, реализующего парадигму Harnessed Agentic RL, где для обучения используется тот же агентный «harness», что и в деплое, через прокси LLM.
  2. Фреймворк поддерживает запуск агентов как Kubernetes‑job’ы, исключает необходимость переработки harness’а для тренировки и включает пример обучения кодирующего агента, поднявшего Pass@1 Qwen3.5-9B на SWE-bench Verified с 41.8% до 56.4% на ~6 000 образцах.
  3. Важно, потому что обучение на реальном harness’е устраняет дорогостоящую переработку агента, повышает соответствие обучения и деплоя и демонстрирует данные‑эффективный прирост в компактном воспроизводимом коде.

ПОЧЕМУ ЭТО ВАЖНО

Важно, потому что обучение на реальном harness’е устраняет дорогостоящую переработку агента, повышает соответствие обучения и деплоя и демонстрирует данные‑эффективный прирост в компактном воспроизводимом коде.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1