Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #8553

MuSiQue

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Исследование: рационалы в основном влияют на суждения верификатора, а не на точность ответов

Авторы предлагают diagnostic «message-intervention», фиксирующий доказательства и кандидата на ответ и меняющий только рационал, передаваемый от рассуждающего модуля к верификатору. На 400 примерах из MuSiQue, HotpotQA и 2WikiMultiHopQA с DeepSeek в роли генератора и верификатора авторы показывают, что правдивые рационалы почти не повышают точность ответов по сравнению с отсутствием рационала, тогда как искажённые рационалы значительно меняют оценки поддержки (10–22% при «слепом» промпте, 34–55% при явной проверке рационала), а финальные ответы меняются значительно реже (2–30%); аудиты людей показывают случаи чрезмерного доверия модели.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья демонстрирует работу RLVR (с GRPO) на Qwen3.5-0.8B без дистилляции

Препринт на arXiv применяет Reinforcement Learning with Verifiable Rewards (RLVR) с Group Relative Policy Optimization (GRPO) и инструментом поиска в Wikipedia для тренировки Qwen3.5-0.8B на MuSiQue и наборе из семи QA-бенчмарков. Лучший запуск показал 0.352 в среднем по exact-match (против 0.092 у нетренированной модели), рост в 3.8× без дистилляции; авторы отмечают, что форма вознаграждения важна — разреженное exact-match-вознаграждение оказывается худшим для этой шкалы модели.

6.0