Обучение с подкреплением оптимизирует управление поляризацией в криогенной мишени APOLLO (arXiv:2610.02452v1)
В статье arXiv:2610.02452v1 предложен подход на основе данных, объединяющий суррогатное моделирование (гауссовские процессы и многослойные перцептроны) с агентом обучения с подкреплением для оптимизации настройки частоты микроволн в динамически поляризованных мишенях на данных криогенной системы APOLLO. Авторы отмечают, что гауссовские процессы дают откалиброванные оценки неопределённости и выявляют выходы за пределы распределения, внедрили приближение GP в симулятор, обучили агента с LCB-наградой для баланса между производительностью и неопределённостью и сообщают примерно двукратное улучшение по сравнению с действиями операторов.