Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1013

Статья демонстрирует работу RLVR (с GRPO) на Qwen3.5-0.8B без дистилляции

Препринт на arXiv применяет Reinforcement Learning with Verifiable Rewards (RLVR) с Group Relative Policy Optimization (GRPO) и инструментом поиска в Wikipedia для тренировки Qwen3.5-0.8B на MuSiQue и наборе из семи QA-бенчмарков. Лучший запуск показал 0.352 в среднем по exact-match (против 0.092 у нетренированной модели), рост в 3.8× без дистилляции; авторы отмечают, что форма вознаграждения важна — разреженное exact-match-вознаграждение оказывается худшим для этой шкалы модели.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Препринт на arXiv применяет Reinforcement Learning with Verifiable Rewards (RLVR) с Group Relative Policy Optimization (GRPO) и инструментом поиска в Wikipedia для тренировки Qwen3.5-0.8B на MuSiQue и наборе из семи QA-бенчмарков.
  2. Лучший запуск показал 0.352 в среднем по exact-match (против 0.092 у нетренированной модели), рост в 3.8× без дистилляции; авторы отмечают, что форма вознаграждения важна — разреженное exact-match-вознаграждение оказывается худшим для этой шкалы модели.
  3. Показывает, что RLVR может улучшать маленькие (~0.8B) модели без дистилляции учителя, но критически важен подбор формы вознаграждения, а не простое масштабирование рецептов для больших моделей.

ПОЧЕМУ ЭТО ВАЖНО

Показывает, что RLVR может улучшать маленькие (~0.8B) модели без дистилляции учителя, но критически важен подбор формы вознаграждения, а не простое масштабирование рецептов для больших моделей.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1