Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #7644

PubMedQA

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

HARDEN: ограниченный эволюционный поиск для создания более сложных оценочных случаев с сохранением ответов

HARDEN — метод ограниченного эволюционного поиска, который превращает входные данные существующих оценочных случаев в более сложные варианты, сохраняя ожидаемые ответы и соблюдая ограничения выполнимости (семантика, реалистичность, валидность исполнения). Применённый к FinQA, PubMedQA и ContractNLI на трёх масштабах Qwen3.5, HARDEN снизил точность моделей в среднем на 22,7% и до 49,9% по сравнению с одноразовыми базовыми подходами при тех же проверках выполнимости.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья о Large Knowledge Model (LKM) преобразует литературу в графы рассуждений и создает «ландшафт научного рассуждения»

В статье представлен Large Knowledge Model (LKM) — инфраструктура масштаба корпуса, которая представляет статьи в виде источнико-обоснованных графов рассуждений и выравнивает вопросы, утверждения и цепочки рассуждений между публикациями, формируя трехчастный «ландшафт научного рассуждения» (вопросы, рабочие процессы, доказательства). Описана архитектура и оценка: при фиксированной модели ответов поиск по LKM повышает точность на 9,30%, 4,20% и 14,69% на наборах ChemBench, PubMedQA и SciBench соответственно, а также поддерживает поиск с учетом рассуждений, проверяемые ответы и планирование исследований.

7.0