Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #10911

PPO

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

COMPANIES · 1 ИСТОЧН. · AWS Machine Learning

Amazon SageMaker AI демонстрирует дообучение поисковых агентов с помощью многошагового RL (MTRL) на Qwen3.6-27B

В публикации Amazon описывает использование возможностей многошагового обучения с подкреплением (MTRL) в Amazon SageMaker AI для дообучения модели Qwen3.6-27B под поискового агента. Статья перечисляет возможности MTRL — бессерверное выполнение, модульный интерфейс агент–окружение, асинхронные роллауты, встроенные алгоритмы (PPO, CISPO, IS), наблюдаемость траекторий через MLflow и задачи оценки — и показывает пример с BM25 и векторным поиском для корпоративного поиска.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Механистический аудит самонаходящегося правила RL Disco103: когда история обучения — преимущество или обуза

В статье arXiv:2609.35897v1 выполнен первый причинно-реалистичный аудит самонаходящегося правила обновления для обучения с подкреплением (Disco103). Путём прицельного закрепления, заморозки и трансплантации рекуррентных состояний при фиксированных метапараметрах авторы выделяют три результата: история расширяет применимые шкалы вознаграждения (шестидесятилетнее окно против трёх при нулевом закреплении), штрафы за несовпадающую историю связаны с постоянным «зажатием» — что ослабевает, если импортированному состоянию разрешить развиваться, и контроль удержания реплея может обратить кажущееся преимущество адаптации над DQN в условиях смены среды; результаты подтверждены на втором правиле (OPEN).

7.0