Статья LLM-as-an-Improver предлагает Verify–Repair–Reselect (VRR) для генерации улучшенных кандидатов с помощью верификации
В работе arXiv:2609.19515v1 представлена LLM-as-an-Improver и метод Verify–Repair–Reselect (VRR), который использует обратную связь от верификатора не только для ранжирования, но и для генерации и повторного выбора улучшенных кандидатов. VRR сохраняет первоначального победителя, условно генерирует исправленные и альтернативные решения, фильтрует некорректные и дублирующие кандидаты только по сигналам во время инференса и снова выбирает ответ по исходным критериям; авторы сообщают о преимуществах над фиксированным пулом кандидатов на нескольких моделях и в задачах генерации кода и рассуждений, в том числе когда в начальном пуле не было корректных ответов.