Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #7775

FrozenLake

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Tропическая обучаемость с подкреплением (TROPIC): замена суммы на максимум для композиции решений

Представлен доклад на arXiv, предлагающий «тропическое» обучение с подкреплением: вместо суммирования вероятностей альтернатив используется максимум (тропическая полукольцо), так что значение состояния — логарифм вероятности наиболее вероятного проверенного решения с явным воспроизводимым путем. Авторы предлагают алгоритм TROPIC для детерминированных, сбрасываемых сред с проверяемыми исходами и приводят улучшение до 16 процентных пунктов по четырем задачам (Sokoban, Countdown, FrozenLake, WebShop) по сравнению с сильными on-policy бюджетами.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

RLDS: разложение вознаграждения по подтаскам улучшает RL для агентов на языковых моделях (arXiv:2609.27035v1)

В работе предлагается Reinforcement Learning with Decomposed Subtasks (RLDS) и Subtask-Decomposed Advantage Estimation (SDAE): вместо сворачивания траекторного вознаграждения в одно скалярное значение они распределяют его по подтаскам перед обновлением политики. На четырёх бенчмарках метод давал значительные улучшения при высокой неоднородности подтасков (ScienceWorld +11.5 пунктов, paired-bootstrap 95% CI [+9.8, +13.3]; FrozenLake +9.8 пунктов, CI [+7.0, +12.8]), почти не менял результаты там, где диагностика предсказывала мало выиграть (HotpotQA, DeepResearch), и был эффективнее по времени на ScienceWorld (-10.9% wall-clock на шаг).

7.0