Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1254

Механистический аудит самонаходящегося правила RL Disco103: когда история обучения — преимущество или обуза

В статье arXiv:2609.35897v1 выполнен первый причинно-реалистичный аудит самонаходящегося правила обновления для обучения с подкреплением (Disco103). Путём прицельного закрепления, заморозки и трансплантации рекуррентных состояний при фиксированных метапараметрах авторы выделяют три результата: история расширяет применимые шкалы вознаграждения (шестидесятилетнее окно против трёх при нулевом закреплении), штрафы за несовпадающую историю связаны с постоянным «зажатием» — что ослабевает, если импортированному состоянию разрешить развиваться, и контроль удержания реплея может обратить кажущееся преимущество адаптации над DQN в условиях смены среды; результаты подтверждены на втором правиле (OPEN).

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье arXiv:2609.35897v1 выполнен первый причинно-реалистичный аудит самонаходящегося правила обновления для обучения с подкреплением (Disco103).
  2. Путём прицельного закрепления, заморозки и трансплантации рекуррентных состояний при фиксированных метапараметрах авторы выделяют три результата: история расширяет применимые шкалы вознаграждения (шестидесятилетнее окно против трёх при нулевом закреплении), штрафы за несовпадающую историю связаны с постоянным «зажатием» — что ослабевает, если импортированному состоянию разрешить развиваться, и контроль удержания реплея может обратить кажущееся преимущество адаптации над DQN в условиях смены среды; результаты подтверждены на втором правиле (OPEN).
  3. Это связывает макро-цели рекурсивного самоулучшения с конкретной, проверяемой динамикой обучения: понимание, когда внутренняя история обучения помогает или вредит, важно для проектирования и аудита саморасширяющихся RL-алгоритмов.

ПОЧЕМУ ЭТО ВАЖНО

Это связывает макро-цели рекурсивного самоулучшения с конкретной, проверяемой динамикой обучения: понимание, когда внутренняя история обучения помогает или вредит, важно для проектирования и аудита саморасширяющихся RL-алгоритмов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1