Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #8441

self-distillation

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · Apple Machine Learning Research

RISED: Отбор данных по рубрикам и самодистилляция для многосредовых LLM-агентов

Авторы предлагают RISED — метод, в котором общая рубричная лексика и LLM-судья маркируют роллауты в разных интерактивных средах; профили рубрик используются для онлайн-отбора данных, положительные рубрики служат привилегированным контекстом для он-полиcи самодистилляции, а отрицательные рубрики смещают генерацию роллаутов от повторяющихся ошибок. В статье сообщается, что RISED, по данным авторов, демонстрирует наивысший средний показатель прохождения по средам и занимает первое или второе место в каждой среде, а также проведён рубричный анализ изменений в поведении.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Privileged Self-Practice (PSP) для многошаговых LLM-агентов (arXiv:2609.29051v1)

В препринте на arXiv показан дефект на-политики самоструктурации (OPSD) для многошаговых агентов — модель становится уверенной, но без реальной информации, — и предложен метод Privileged Self-Practice (PSP). PSP сохраняет привилегированную информацию (PI) в подсказке/семплере: при неудачных откатах анализатор добавляет короткую инструкцию в контекст, задачу пересэмплируют и обучают по тому же GRPO-объективу; на AppWorld и SWE-bench Verified (с тремя студент-моделями) PSP стабильно опережает OPSD и обычный GRPO, повышая достижение целей задач до 65% на AppWorld и долю решённых задач до 61% на SWE-bench Verified.

7.0