CoVer: награды на основе информационной выгоды и отбор разнообразных тестов для более надёжной генерации кода
В статье arXiv:2609.21208v1 предложен CoVer — единая GRPO-схема совместного обучения кодера и верификатора с наградой на основе информационной выгоды (взаимная информация с градуированной сигнализацией правильности) и трёхступенчатой фильтрацией тестов по разнообразию. Авторы сообщают улучшение one-shot pass@1 по сравнению с Qwen2.5-Instruct (+5.8 пункта при 7B, +7.1 пункта при 14B) на пяти бенчмарках и +3.5 пункта при интеграции в CodeT с 7B.