ИССЛЕДОВАНИЕ · RESEARCH · #1344
GAD-RL: адаптивная комбинированная дистилляция для повышения точности OCR
В статье (arXiv:2609.38282v1) предложен метод GAD-RL, который адаптивно включает и ослабляет учительскую дистилляцию при совместной дообучении для повышения верности OCR в визуально-языковых моделях. На Qwen3.5-2B GAD-RL отключает дистилляцию для групп откликов с высоким вознаграждением, взвешивает прямой KL по вероятности студента для топ‑токена учителя и достигает 59.92% Micro Recall на CHAOS-Bench (лучше GRPO и GRPO+OPD на 8.45 и 4.43 пункта) и Overall 91.18 на OmniDocBench v1.6.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье (arXiv:2609.38282v1) предложен метод GAD-RL, который адаптивно включает и ослабляет учительскую дистилляцию при совместной дообучении для повышения верности OCR в визуально-языковых моделях.
- На Qwen3.5-2B GAD-RL отключает дистилляцию для групп откликов с высоким вознаграждением, взвешивает прямой KL по вероятности студента для топ‑токена учителя и достигает 59.92% Micro Recall на CHAOS-Bench (лучше GRPO и GRPO+OPD на 8.45 и 4.43 пункта) и Overall 91.18 на OmniDocBench v1.6.
- Адаптивное регулирование учительской супервизии сохраняет верность транскрипций и даёт заметное улучшение качества OCR на общепринятых бенчмарках.
ПОЧЕМУ ЭТО ВАЖНО
Адаптивное регулирование учительской супервизии сохраняет верность транскрипций и даёт заметное улучшение качества OCR на общепринятых бенчмарках.