ИССЛЕДОВАНИЕ · RESEARCH · #1004
AlphaDiverse: пост-тренировка локальных исследовательских агентов для разнообразного поиска альфа-факторов (arXiv:2609.29014v1)
AlphaDiverse — это фреймворк для LLM-ориентированных многoагентных исследований альфа-факторов, который формирует разнообразные следы исследований через варьирование планов и сред, затем подготавливает локальные агенты Planner и Realizer супервизированной дообучкой и совместной оптимизацией методом GRPO. Обратная связь ограничивается внутренним периодом, а финальная замороженная модель оценивается на внешнем периоде без подстройки под тест, эксперименты на четырёх китайских рынках показывают конкурентную предсказательную способность и более широкую эксплорацию.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- AlphaDiverse — это фреймворк для LLM-ориентированных многoагентных исследований альфа-факторов, который формирует разнообразные следы исследований через варьирование планов и сред, затем подготавливает локальные агенты Planner и Realizer супервизированной дообучкой и совместной оптимизацией методом GRPO.
- Обратная связь ограничивается внутренним периодом, а финальная замороженная модель оценивается на внешнем периоде без подстройки под тест, эксперименты на четырёх китайских рынках показывают конкурентную предсказательную способность и более широкую эксплорацию.
- Метод демонстрирует, как локальная дообучка агентов и сбор разнообразных траекторий исследований могут снизить зависимость от внешних API и коллапс путей исследований, обеспечив более надёжные альфа-открытия с оценкой вне выборки.
ПОЧЕМУ ЭТО ВАЖНО
Метод демонстрирует, как локальная дообучка агентов и сбор разнообразных траекторий исследований могут снизить зависимость от внешних API и коллапс путей исследований, обеспечив более надёжные альфа-открытия с оценкой вне выборки.