НОВОСТЬ · RESEARCH · #346
ReDraft: пересмотр на основе эталона для непрерывного дообучения VLLM
В статье на arXiv (2609.16639v1) представлен метод ReDraft для непрерывного дообучения: модель исправляет собственные неверные развертки с опорой на экспертный ответ как эталон, проверки принимают исправления, и на них выполняется дообучение. На Qwen2.5-VL-3B/7B по задачам Counting, Clock Reading и Jigsaw ReDraft даёт бoльшие приросты по целевым задачам, существенно сокращая забывание и улучшая метрики OPSD по обеим осям.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье на arXiv (2609.16639v1) представлен метод ReDraft для непрерывного дообучения: модель исправляет собственные неверные развертки с опорой на экспертный ответ как эталон, проверки принимают исправления, и на них выполняется дообучение.
- На Qwen2.5-VL-3B/7B по задачам Counting, Clock Reading и Jigsaw ReDraft даёт бoльшие приросты по целевым задачам, существенно сокращая забывание и улучшая метрики OPSD по обеим осям.
- ReDraft формирует явные, но близкие к текущей политике целевые примеры из собственных ошибок модели, что улучшает изучение новых задач и значительно сокращает катастрофическое забывание при непрерывном дообучении мультимоделей.
ПОЧЕМУ ЭТО ВАЖНО
ReDraft формирует явные, но близкие к текущей политике целевые примеры из собственных ошибок модели, что улучшает изучение новых задач и значительно сокращает катастрофическое забывание при непрерывном дообучении мультимоделей.