ИССЛЕДОВАНИЕ · RESEARCH · #1462
Кэти Ву (MIT) и команда разработали алгоритм выбора задач для RL, повышающий эффективность обучения до 30× (2023)
Исследователи под руководством профессора MIT Кэти Ву выявили чувствительность RL к близким задачам в трафике и в 2023 году предложили алгоритм выбора подмножества задач, на которых RL хорошо обучается; обучая модели на этих задачах и комбинируя их, команда сообщила об улучшении эффективности обучения до 30× и лучшей обобщаемости на смежных транспортных задачах. Эта работа опирается на раннее исследование Ву 2018 года и диагностику хрупкости RL 2022 года.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Исследователи под руководством профессора MIT Кэти Ву выявили чувствительность RL к близким задачам в трафике и в 2023 году предложили алгоритм выбора подмножества задач, на которых RL хорошо обучается; обучая модели на этих задачах и комбинируя их, команда сообщила об улучшении эффективности обучения до 30× и лучшей обобщаемости на смежных транспортных задачах.
- Эта работа опирается на раннее исследование Ву 2018 года и диагностику хрупкости RL 2022 года.
- Если подход окажется надёжным, выбор задач для обучения может сделать RL практичным и значительно более эффективным для проектирования и оценки сложных транспортных систем.
ПОЧЕМУ ЭТО ВАЖНО
Если подход окажется надёжным, выбор задач для обучения может сделать RL практичным и значительно более эффективным для проектирования и оценки сложных транспортных систем.