Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #11751

CARAT benchmark

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

CARAT (arXiv:2609.38340v1): бенчмарк проверяет, размышляют ли LLM для материалов или переписывают

В новом препринте (arXiv:2609.38340v1) представлен CARAT — бенчмарк, который фиксирует вопрос и эталонный ответ в восьми согласованных представлениях и вводит контрольные приёмы (маскировка ответов, внедрение доказательств, парный вывод, сопоставленное дообучение), чтобы выяснить, выводят ли LLM для материалов структурные отношения или просто повторяют текст. Основные результаты: заземлённое представление превосходит входы по формулам на 17.3 пункта; GraphSpace лучше простого периодического графа на 19.3 пункта (1.96 пункта там, где простой рендер уже содержит нужные поля, и 46.7 пункта там, где он их опускает); модель часто цитирует ссылку, не используя её (95.6% парных случаев), сопоставленное дообучение повышает это до 99.8%, а удаление ссылки снижает показатель до 23.4%, ниже хитрой базовой 27.0%.

6.0