Кэти Ву (MIT) и команда разработали алгоритм выбора задач для RL, повышающий эффективность обучения до 30× (2023)
Исследователи под руководством профессора MIT Кэти Ву выявили чувствительность RL к близким задачам в трафике и в 2023 году предложили алгоритм выбора подмножества задач, на которых RL хорошо обучается; обучая модели на этих задачах и комбинируя их, команда сообщила об улучшении эффективности обучения до 30× и лучшей обобщаемости на смежных транспортных задачах. Эта работа опирается на раннее исследование Ву 2018 года и диагностику хрупкости RL 2022 года.