Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · RESEARCH · #346

ReDraft: пересмотр на основе эталона для непрерывного дообучения VLLM

В статье на arXiv (2609.16639v1) представлен метод ReDraft для непрерывного дообучения: модель исправляет собственные неверные развертки с опорой на экспертный ответ как эталон, проверки принимают исправления, и на них выполняется дообучение. На Qwen2.5-VL-3B/7B по задачам Counting, Clock Reading и Jigsaw ReDraft даёт бoльшие приросты по целевым задачам, существенно сокращая забывание и улучшая метрики OPSD по обеим осям.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье на arXiv (2609.16639v1) представлен метод ReDraft для непрерывного дообучения: модель исправляет собственные неверные развертки с опорой на экспертный ответ как эталон, проверки принимают исправления, и на них выполняется дообучение.
  2. На Qwen2.5-VL-3B/7B по задачам Counting, Clock Reading и Jigsaw ReDraft даёт бoльшие приросты по целевым задачам, существенно сокращая забывание и улучшая метрики OPSD по обеим осям.
  3. ReDraft формирует явные, но близкие к текущей политике целевые примеры из собственных ошибок модели, что улучшает изучение новых задач и значительно сокращает катастрофическое забывание при непрерывном дообучении мультимоделей.

ПОЧЕМУ ЭТО ВАЖНО

ReDraft формирует явные, но близкие к текущей политике целевые примеры из собственных ошибок модели, что улучшает изучение новых задач и значительно сокращает катастрофическое забывание при непрерывном дообучении мультимоделей.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1