Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1405

Предпечатная публикация arXiv «Predictive Credit» v1: смешанные/неконкретные эффекты объяснений ИИ на прогнозы экспериментов

Предпечатная работа «Predictive Credit» (v1) предлагает протокол для измерения того, добавляют ли объяснения от исследовательских агентов прогностическую ценность к запланированным экспериментам, сравнивая пары прогнозов, различающиеся только объяснением и контекстом донора. Авторы сообщают в целом неконкретные результаты по так называемому кредиту естественных объяснений (например, решение для «v5» было неубедительным, а пререгистированный тест вреда по ROC AUC для Tox21 не подтвердился: D-M = -0.0026, 95% интервал [-0.0174, 0.0104]); при этом отдельные вмешательства моделей давали заметные эффекты (DeepSeek V4 Pro: снижение вторичного дрейфа Tox21 на 64.5% и 59.1% для matched и donor карт; DeepSeek V4 Flash повысил matched point MAE с 0.01823 до 0.02020). Контрольный механизм, написанный исследователем, снизил point MAE на 2.60 процентных пункта относительно описания, но общих подтверждений улучшения точности из объяснений не получено, а многие интервалы перекрывали ноль.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Предпечатная работа «Predictive Credit» (v1) предлагает протокол для измерения того, добавляют ли объяснения от исследовательских агентов прогностическую ценность к запланированным экспериментам, сравнивая пары прогнозов, различающиеся только объяснением и контекстом донора.
  2. Авторы сообщают в целом неконкретные результаты по так называемому кредиту естественных объяснений (например, решение для «v5» было неубедительным, а пререгистированный тест вреда по ROC AUC для Tox21 не подтвердился: D-M = -0.0026, 95% интервал [-0.0174, 0.0104]); при этом отдельные вмешательства моделей давали заметные эффекты (DeepSeek V4 Pro: снижение вторичного дрейфа Tox21 на 64.5% и 59.1% для matched и donor карт; DeepSeek V4 Flash повысил matched point MAE с 0.01823 до 0.02020).
  3. Контрольный механизм, написанный исследователем, снизил point MAE на 2.60 процентных пункта относительно описания, но общих подтверждений улучшения точности из объяснений не получено, а многие интервалы перекрывали ноль.

ПОЧЕМУ ЭТО ВАЖНО

Предлагает формализованный пререгистерованный протокол и эмпирические данные о том, улучшают ли сгенерированные ИИ объяснения экспериментальные прогнозы, что важно для оценки и внедрения бенчмарков исследовательских агентов и инструментов научного прогнозирования.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1