Механистический аудит самонаходящегося правила RL Disco103: когда история обучения — преимущество или обуза
В статье arXiv:2609.35897v1 выполнен первый причинно-реалистичный аудит самонаходящегося правила обновления для обучения с подкреплением (Disco103). Путём прицельного закрепления, заморозки и трансплантации рекуррентных состояний при фиксированных метапараметрах авторы выделяют три результата: история расширяет применимые шкалы вознаграждения (шестидесятилетнее окно против трёх при нулевом закреплении), штрафы за несовпадающую историю связаны с постоянным «зажатием» — что ослабевает, если импортированному состоянию разрешить развиваться, и контроль удержания реплея может обратить кажущееся преимущество адаптации над DQN в условиях смены среды; результаты подтверждены на втором правиле (OPEN).