Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #11949

RLTL;DR

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · Apple Machine Learning Research

RLTL;DR — самоулучшение через интернализацию самостоятельно сгенерированной обратной связи

RLTL;DR — метод обучения с подкреплением, в котором после каждой неудачной попытки агент видит вывод проверяющей системы и записывает одно краткое TL;DR‑наблюдение; последующие прогоны условлены на накопленных наблюдениях, а обучение проводит обратное распространение через эти контекстные наблюдения для интернализации соответствия задача→наблюдение. На сложных наборах для вызова инструментов и кодирования, отфильтрованных до Pass@128 = 0, GRPO для Qwen 3.5 9B демонстрирует Pass@1 ≈ 0–1%, тогда как RLTL;DR даёт Pass@1 = 14–31% при наличии наблюдений в контексте во время обучения и 12–13% при оценке без наблюдений; упрощённая версия SFTL;DR, обученная только на 4k пар (задача, наблюдение), почти восстанавливает полную производительность, что указывает на компактную парадигму обучения «имей это в виду».

8.0