ИССЛЕДОВАНИЕ · RESEARCH · #1393
SciSlopBench и SciSlopHarness (arXiv:2610.00531v1): бенчмарки и смягчение «научного шлака» в статьях, сгенерированных ИИ
В статье на arXiv представлены SciSlopBench — набор из 390 статей, сгенерированных ИИ, сопоставленных с человеческими статьями, и шесть метрик по структуре, аргументации и артефактам для оценки «научного шлака» — случаев, когда отдельные части выглядят правдоподобно, но связующая научная логика нарушена. Авторы показывают, что их метрики распознают ИИ-статью в паре с точностью 85,9% (против 68,7% у Binoculars), что более высокий шлак связан с более низкими оценками ICLR и отклонениями в 2017–2025 годах, и предлагают SciSlopHarness — фреймворк для ревизии LLM, уменьшающий разрыв между ИИ и человеком на 63% по сравнению с сильнейшим базовым методом без использования человеческих эталонов.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье на arXiv представлены SciSlopBench — набор из 390 статей, сгенерированных ИИ, сопоставленных с человеческими статьями, и шесть метрик по структуре, аргументации и артефактам для оценки «научного шлака» — случаев, когда отдельные части выглядят правдоподобно, но связующая научная логика нарушена.
- Авторы показывают, что их метрики распознают ИИ-статью в паре с точностью 85,9% (против 68,7% у Binoculars), что более высокий шлак связан с более низкими оценками ICLR и отклонениями в 2017–2025 годах, и предлагают SciSlopHarness — фреймворк для ревизии LLM, уменьшающий разрыв между ИИ и человеком на 63% по сравнению с сильнейшим базовым методом без использования человеческих эталонов.
- Работа демонстрирует системные следы нарушения глобальной научной логики в статьях ИИ и предлагает практичное решение, основанное на доказательной ревизии, важное для научной честности и рецензирования.
ПОЧЕМУ ЭТО ВАЖНО
Работа демонстрирует системные следы нарушения глобальной научной логики в статьях ИИ и предлагает практичное решение, основанное на доказательной ревизии, важное для научной честности и рецензирования.