ИССЛЕДОВАНИЕ · RESEARCH · #1684
Microsoft Research Asia опубликовала Agent Lightning v1.0 — лёгкий фреймворк Harnessed Agentic RL
Microsoft Research Asia выпустила Agent Lightning v1.0 — примерно 3 500 строк открытого кода, реализующего парадигму Harnessed Agentic RL, где для обучения используется тот же агентный «harness», что и в деплое, через прокси LLM. Фреймворк поддерживает запуск агентов как Kubernetes‑job’ы, исключает необходимость переработки harness’а для тренировки и включает пример обучения кодирующего агента, поднявшего Pass@1 Qwen3.5-9B на SWE-bench Verified с 41.8% до 56.4% на ~6 000 образцах.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Microsoft Research Asia выпустила Agent Lightning v1.0 — примерно 3 500 строк открытого кода, реализующего парадигму Harnessed Agentic RL, где для обучения используется тот же агентный «harness», что и в деплое, через прокси LLM.
- Фреймворк поддерживает запуск агентов как Kubernetes‑job’ы, исключает необходимость переработки harness’а для тренировки и включает пример обучения кодирующего агента, поднявшего Pass@1 Qwen3.5-9B на SWE-bench Verified с 41.8% до 56.4% на ~6 000 образцах.
- Важно, потому что обучение на реальном harness’е устраняет дорогостоящую переработку агента, повышает соответствие обучения и деплоя и демонстрирует данные‑эффективный прирост в компактном воспроизводимом коде.
ПОЧЕМУ ЭТО ВАЖНО
Важно, потому что обучение на реальном harness’е устраняет дорогостоящую переработку агента, повышает соответствие обучения и деплоя и демонстрирует данные‑эффективный прирост в компактном воспроизводимом коде.