Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #717

CoVer: награды на основе информационной выгоды и отбор разнообразных тестов для более надёжной генерации кода

В статье arXiv:2609.21208v1 предложен CoVer — единая GRPO-схема совместного обучения кодера и верификатора с наградой на основе информационной выгоды (взаимная информация с градуированной сигнализацией правильности) и трёхступенчатой фильтрацией тестов по разнообразию. Авторы сообщают улучшение one-shot pass@1 по сравнению с Qwen2.5-Instruct (+5.8 пункта при 7B, +7.1 пункта при 14B) на пяти бенчмарках и +3.5 пункта при интеграции в CodeT с 7B.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье arXiv:2609.21208v1 предложен CoVer — единая GRPO-схема совместного обучения кодера и верификатора с наградой на основе информационной выгоды (взаимная информация с градуированной сигнализацией правильности) и трёхступенчатой фильтрацией тестов по разнообразию.
  2. Авторы сообщают улучшение one-shot pass@1 по сравнению с Qwen2.5-Instruct (+5.8 пункта при 7B, +7.1 пункта при 14B) на пяти бенчмарках и +3.5 пункта при интеграции в CodeT с 7B.
  3. Награждая тесты за реальную информационную ценность и отбрасывая избыточные случаи, CoVer адресует два ключевых провала self-play RL для генерации кода, повышая надёжность оценок и pass@1.

ПОЧЕМУ ЭТО ВАЖНО

Награждая тесты за реальную информационную ценность и отбрасывая избыточные случаи, CoVer адресует два ключевых провала self-play RL для генерации кода, повышая надёжность оценок и pass@1.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1