Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1340

CARAT (arXiv:2609.38340v1): бенчмарк проверяет, размышляют ли LLM для материалов или переписывают

В новом препринте (arXiv:2609.38340v1) представлен CARAT — бенчмарк, который фиксирует вопрос и эталонный ответ в восьми согласованных представлениях и вводит контрольные приёмы (маскировка ответов, внедрение доказательств, парный вывод, сопоставленное дообучение), чтобы выяснить, выводят ли LLM для материалов структурные отношения или просто повторяют текст. Основные результаты: заземлённое представление превосходит входы по формулам на 17.3 пункта; GraphSpace лучше простого периодического графа на 19.3 пункта (1.96 пункта там, где простой рендер уже содержит нужные поля, и 46.7 пункта там, где он их опускает); модель часто цитирует ссылку, не используя её (95.6% парных случаев), сопоставленное дообучение повышает это до 99.8%, а удаление ссылки снижает показатель до 23.4%, ниже хитрой базовой 27.0%.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В новом препринте (arXiv:2609.38340v1) представлен CARAT — бенчмарк, который фиксирует вопрос и эталонный ответ в восьми согласованных представлениях и вводит контрольные приёмы (маскировка ответов, внедрение доказательств, парный вывод, сопоставленное дообучение), чтобы выяснить, выводят ли LLM для материалов структурные отношения или просто повторяют текст.
  2. Основные результаты: заземлённое представление превосходит входы по формулам на 17.3 пункта; GraphSpace лучше простого периодического графа на 19.3 пункта (1.96 пункта там, где простой рендер уже содержит нужные поля, и 46.7 пункта там, где он их опускает); модель часто цитирует ссылку, не используя её (95.6% парных случаев), сопоставленное дообучение повышает это до 99.8%, а удаление ссылки снижает показатель до 23.4%, ниже хитрой базовой 27.0%.
  3. Это важно, потому что CARAT выявляет, что доменные LLM могут казаться корректными, повторяя ввод или ссылки, а не опираясь на доказательства, — что подчёркивает необходимость контролируемых бенчмарков и методов обучения/тестирования в научных приложениях.

ПОЧЕМУ ЭТО ВАЖНО

Это важно, потому что CARAT выявляет, что доменные LLM могут казаться корректными, повторяя ввод или ссылки, а не опираясь на доказательства, — что подчёркивает необходимость контролируемых бенчмарков и методов обучения/тестирования в научных приложениях.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1