ИССЛЕДОВАНИЕ · RESEARCH · #1319
arXiv:2609.38621v1 — Сопоставление научных результатов LLM зависит от стиля текста и биологических априорий
Статья исследует, как модели языка решают, противоречат ли друг другу два научных отчёта, переводя несостоятельную систему XOR в текст лабораторных отчётов. При формулировке ограничений напрямую GPT-5.6 Sol и Claude Opus 5 выбирают лучше подтверждённое решение в 90% и 96% случаев соответственно; в научной прозе Claude Opus 5 часто предпочитает биологически ожидаемое, но менее поддержанное решение — восстановление повышается с 27% до 79% после удаления биологической предвзятости и достигает 92% при запросе формализации и явном указании парного дизайна (p<.001); GPT-5.6 Sol реагирует менее чувствительно и изменения не были статистически значимыми.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья исследует, как модели языка решают, противоречат ли друг другу два научных отчёта, переводя несостоятельную систему XOR в текст лабораторных отчётов.
- При формулировке ограничений напрямую GPT-5.6 Sol и Claude Opus 5 выбирают лучше подтверждённое решение в 90% и 96% случаев соответственно; в научной прозе Claude Opus 5 часто предпочитает биологически ожидаемое, но менее поддержанное решение — восстановление повышается с 27% до 79% после удаления биологической предвзятости и достигает 92% при запросе формализации и явном указании парного дизайна (p<.001); GPT-5.6 Sol реагирует менее чувствительно и изменения не были статистически значимыми.
- Показывает, что верификация научных противоречий с помощью LLM требует контроля не только формального вывода, но и того, как текст и подразумеваемые априории влияют на выбор сравниваемых результатов.
ПОЧЕМУ ЭТО ВАЖНО
Показывает, что верификация научных противоречий с помощью LLM требует контроля не только формального вывода, но и того, как текст и подразумеваемые априории влияют на выбор сравниваемых результатов.