ИССЛЕДОВАНИЕ · RESEARCH · #1510
Обучение с подкреплением оптимизирует управление поляризацией в криогенной мишени APOLLO (arXiv:2610.02452v1)
В статье arXiv:2610.02452v1 предложен подход на основе данных, объединяющий суррогатное моделирование (гауссовские процессы и многослойные перцептроны) с агентом обучения с подкреплением для оптимизации настройки частоты микроволн в динамически поляризованных мишенях на данных криогенной системы APOLLO. Авторы отмечают, что гауссовские процессы дают откалиброванные оценки неопределённости и выявляют выходы за пределы распределения, внедрили приближение GP в симулятор, обучили агента с LCB-наградой для баланса между производительностью и неопределённостью и сообщают примерно двукратное улучшение по сравнению с действиями операторов.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье arXiv:2610.02452v1 предложен подход на основе данных, объединяющий суррогатное моделирование (гауссовские процессы и многослойные перцептроны) с агентом обучения с подкреплением для оптимизации настройки частоты микроволн в динамически поляризованных мишенях на данных криогенной системы APOLLO.
- Авторы отмечают, что гауссовские процессы дают откалиброванные оценки неопределённости и выявляют выходы за пределы распределения, внедрили приближение GP в симулятор, обучили агента с LCB-наградой для баланса между производительностью и неопределённостью и сообщают примерно двукратное улучшение по сравнению с действиями операторов.
- Показывает, что сочетание откалиброванных суррогатных моделей с обучением с подкреплением может существенно улучшить автоматическое управление сложным экспериментальным оборудованием и учесть неопределённость, снижая необходимость ручной настройки.
ПОЧЕМУ ЭТО ВАЖНО
Показывает, что сочетание откалиброванных суррогатных моделей с обучением с подкреплением может существенно улучшить автоматическое управление сложным экспериментальным оборудованием и учесть неопределённость, снижая необходимость ручной настройки.