Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #8437

SWE-bench Verified

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

4

RESEARCH · 1 ИСТОЧН. · Microsoft Research

Microsoft Research Asia опубликовала Agent Lightning v1.0 — лёгкий фреймворк Harnessed Agentic RL

Microsoft Research Asia выпустила Agent Lightning v1.0 — примерно 3 500 строк открытого кода, реализующего парадигму Harnessed Agentic RL, где для обучения используется тот же агентный «harness», что и в деплое, через прокси LLM. Фреймворк поддерживает запуск агентов как Kubernetes‑job’ы, исключает необходимость переработки harness’а для тренировки и включает пример обучения кодирующего агента, поднявшего Pass@1 Qwen3.5-9B на SWE-bench Verified с 41.8% до 56.4% на ~6 000 образцах.

7.0

RESEARCH · 1 ИСТОЧН. · Apple Machine Learning Research

SCLATE: платформа для обучения и оценки агентов с непрерывным обучением

SCLATE — это исполнимый субстрат, который объединяет планирование событий для бенчмарков и немодифицированных агентов через открытый планировщик и гибридные симулированные часы, сокращая месячные многосессионные сценарии до часов и записывая каждый вызов модели через прокси внутри контейнера. Авторы портировали семь бенчмарков и протестировали десять конфигураций «harness»/памяти на десяти моделях, обнаружив, что дополнительные системы памяти не всегда превосходят нативную память harness; они также док-обучили Qwen3.5-4B с немодифицированными harness и памятью, что уменьшило чтение файлов, повысило показатель SWE-bench Verified на 16.7 пункта и увеличило точность MetaClaw до 11.8 пункта.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Исследование выявляет частые дорогие поведения у кодирующих агентов и оценивает способы их смягчения

В статье arXiv:2609.30725v1 проанализированы 1 200 траекторий Claude Code и Mini-SWE-Agent на SWE-bench Verified; выявлены три повторяющихся дорогостоящих поведения (subsumed retrieval, генерация похожих скриптов, повторный запуск тестов), затрагивающих 79–98% задач и составляющих до 22,75% стоимости задачи. Оценены три метода смягчения (structure-aware retrieval, agent-synthesized skills, developer-designed skills) на 10 тыс. отложенных траекторий: structure-aware retrieval иногда увеличивает расходы (до 28,14%), agent-synthesized skills дают ограниченные низкоуровневые улучшения, а developer-designed skills сокращают расходы до 41,73%, примерно вдвое больше максимального эффекта от agent-synthesized skills.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Privileged Self-Practice (PSP) для многошаговых LLM-агентов (arXiv:2609.29051v1)

В препринте на arXiv показан дефект на-политики самоструктурации (OPSD) для многошаговых агентов — модель становится уверенной, но без реальной информации, — и предложен метод Privileged Self-Practice (PSP). PSP сохраняет привилегированную информацию (PI) в подсказке/семплере: при неудачных откатах анализатор добавляет короткую инструкцию в контекст, задачу пересэмплируют и обучают по тому же GRPO-объективу; на AppWorld и SWE-bench Verified (с тремя студент-моделями) PSP стабильно опережает OPSD и обычный GRPO, повышая достижение целей задач до 65% на AppWorld и долю решённых задач до 61% на SWE-bench Verified.

7.0