Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #6732

verifier

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

3

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Исследование: рационалы в основном влияют на суждения верификатора, а не на точность ответов

Авторы предлагают diagnostic «message-intervention», фиксирующий доказательства и кандидата на ответ и меняющий только рационал, передаваемый от рассуждающего модуля к верификатору. На 400 примерах из MuSiQue, HotpotQA и 2WikiMultiHopQA с DeepSeek в роли генератора и верификатора авторы показывают, что правдивые рационалы почти не повышают точность ответов по сравнению с отсутствием рационала, тогда как искажённые рационалы значительно меняют оценки поддержки (10–22% при «слепом» промпте, 34–55% при явной проверке рационала), а финальные ответы меняются значительно реже (2–30%); аудиты людей показывают случаи чрезмерного доверия модели.

7.0

RESEARCH · 1 ИСТОЧН. · Apple Machine Learning Research

RLTL;DR — самоулучшение через интернализацию самостоятельно сгенерированной обратной связи

RLTL;DR — метод обучения с подкреплением, в котором после каждой неудачной попытки агент видит вывод проверяющей системы и записывает одно краткое TL;DR‑наблюдение; последующие прогоны условлены на накопленных наблюдениях, а обучение проводит обратное распространение через эти контекстные наблюдения для интернализации соответствия задача→наблюдение. На сложных наборах для вызова инструментов и кодирования, отфильтрованных до Pass@128 = 0, GRPO для Qwen 3.5 9B демонстрирует Pass@1 ≈ 0–1%, тогда как RLTL;DR даёт Pass@1 = 14–31% при наличии наблюдений в контексте во время обучения и 12–13% при оценке без наблюдений; упрощённая версия SFTL;DR, обученная только на 4k пар (задача, наблюдение), почти восстанавливает полную производительность, что указывает на компактную парадигму обучения «имей это в виду».

8.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

ISA-Bench: эталон задач с ограниченным набором команд для оценки вычислительного рассуждения

Исследователи опубликовали ISA-Bench (arXiv:2609.22878v1) — набор задач‑«игр» на программирование для оценки рассуждений в архитектурах с ограниченным набором команд (ISA). Для каждой задачи предоставлен полный стек выполнения (парсер, виртуальная машина, проверяющий модуль) для автоматической оценки; в экспериментах модели, ориентированные на рассуждение, в среднем опережают модели, специализированные на коде, и универсальные модели, незнакомый синтаксис часто приводит к ошибкам, итеративная обратная связь помогает с переменным эффектом в разных архитектурах, и авторы вводят анализ reasoning–execution gap (REG); код опубликован с открытой лицензией.

7.0