ИССЛЕДОВАНИЕ · RESEARCH · #717
CoVer: награды на основе информационной выгоды и отбор разнообразных тестов для более надёжной генерации кода
В статье arXiv:2609.21208v1 предложен CoVer — единая GRPO-схема совместного обучения кодера и верификатора с наградой на основе информационной выгоды (взаимная информация с градуированной сигнализацией правильности) и трёхступенчатой фильтрацией тестов по разнообразию. Авторы сообщают улучшение one-shot pass@1 по сравнению с Qwen2.5-Instruct (+5.8 пункта при 7B, +7.1 пункта при 14B) на пяти бенчмарках и +3.5 пункта при интеграции в CodeT с 7B.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье arXiv:2609.21208v1 предложен CoVer — единая GRPO-схема совместного обучения кодера и верификатора с наградой на основе информационной выгоды (взаимная информация с градуированной сигнализацией правильности) и трёхступенчатой фильтрацией тестов по разнообразию.
- Авторы сообщают улучшение one-shot pass@1 по сравнению с Qwen2.5-Instruct (+5.8 пункта при 7B, +7.1 пункта при 14B) на пяти бенчмарках и +3.5 пункта при интеграции в CodeT с 7B.
- Награждая тесты за реальную информационную ценность и отбрасывая избыточные случаи, CoVer адресует два ключевых провала self-play RL для генерации кода, повышая надёжность оценок и pass@1.
ПОЧЕМУ ЭТО ВАЖНО
Награждая тесты за реальную информационную ценность и отбрасывая избыточные случаи, CoVer адресует два ключевых провала self-play RL для генерации кода, повышая надёжность оценок и pass@1.