ИССЛЕДОВАНИЕ · RESEARCH · #1254
Механистический аудит самонаходящегося правила RL Disco103: когда история обучения — преимущество или обуза
В статье arXiv:2609.35897v1 выполнен первый причинно-реалистичный аудит самонаходящегося правила обновления для обучения с подкреплением (Disco103). Путём прицельного закрепления, заморозки и трансплантации рекуррентных состояний при фиксированных метапараметрах авторы выделяют три результата: история расширяет применимые шкалы вознаграждения (шестидесятилетнее окно против трёх при нулевом закреплении), штрафы за несовпадающую историю связаны с постоянным «зажатием» — что ослабевает, если импортированному состоянию разрешить развиваться, и контроль удержания реплея может обратить кажущееся преимущество адаптации над DQN в условиях смены среды; результаты подтверждены на втором правиле (OPEN).
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье arXiv:2609.35897v1 выполнен первый причинно-реалистичный аудит самонаходящегося правила обновления для обучения с подкреплением (Disco103).
- Путём прицельного закрепления, заморозки и трансплантации рекуррентных состояний при фиксированных метапараметрах авторы выделяют три результата: история расширяет применимые шкалы вознаграждения (шестидесятилетнее окно против трёх при нулевом закреплении), штрафы за несовпадающую историю связаны с постоянным «зажатием» — что ослабевает, если импортированному состоянию разрешить развиваться, и контроль удержания реплея может обратить кажущееся преимущество адаптации над DQN в условиях смены среды; результаты подтверждены на втором правиле (OPEN).
- Это связывает макро-цели рекурсивного самоулучшения с конкретной, проверяемой динамикой обучения: понимание, когда внутренняя история обучения помогает или вредит, важно для проектирования и аудита саморасширяющихся RL-алгоритмов.
ПОЧЕМУ ЭТО ВАЖНО
Это связывает макро-цели рекурсивного самоулучшения с конкретной, проверяемой динамикой обучения: понимание, когда внутренняя история обучения помогает или вредит, важно для проектирования и аудита саморасширяющихся RL-алгоритмов.