Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1510

Обучение с подкреплением оптимизирует управление поляризацией в криогенной мишени APOLLO (arXiv:2610.02452v1)

В статье arXiv:2610.02452v1 предложен подход на основе данных, объединяющий суррогатное моделирование (гауссовские процессы и многослойные перцептроны) с агентом обучения с подкреплением для оптимизации настройки частоты микроволн в динамически поляризованных мишенях на данных криогенной системы APOLLO. Авторы отмечают, что гауссовские процессы дают откалиброванные оценки неопределённости и выявляют выходы за пределы распределения, внедрили приближение GP в симулятор, обучили агента с LCB-наградой для баланса между производительностью и неопределённостью и сообщают примерно двукратное улучшение по сравнению с действиями операторов.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье arXiv:2610.02452v1 предложен подход на основе данных, объединяющий суррогатное моделирование (гауссовские процессы и многослойные перцептроны) с агентом обучения с подкреплением для оптимизации настройки частоты микроволн в динамически поляризованных мишенях на данных криогенной системы APOLLO.
  2. Авторы отмечают, что гауссовские процессы дают откалиброванные оценки неопределённости и выявляют выходы за пределы распределения, внедрили приближение GP в симулятор, обучили агента с LCB-наградой для баланса между производительностью и неопределённостью и сообщают примерно двукратное улучшение по сравнению с действиями операторов.
  3. Показывает, что сочетание откалиброванных суррогатных моделей с обучением с подкреплением может существенно улучшить автоматическое управление сложным экспериментальным оборудованием и учесть неопределённость, снижая необходимость ручной настройки.

ПОЧЕМУ ЭТО ВАЖНО

Показывает, что сочетание откалиброванных суррогатных моделей с обучением с подкреплением может существенно улучшить автоматическое управление сложным экспериментальным оборудованием и учесть неопределённость, снижая необходимость ручной настройки.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1