Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1010

Гипотезное тестирование с участием человека и ИИ: политика SCALE для экономичной селективной оценки ИИ и эскалации к человеку

В препринте на arXiv (arXiv:2609.28859v1) рассматривается использование оценок ИИ вместе с избирательной проверкой людьми для проведения корректных статистических тестов при контроле ошибок I и II рода и минимальных затратах. Авторы выводят информационно‑теоретическую нижнюю границу затрат, описывают зависимый от отчёта информационный фронтир и представляют SCALE — последовательную политику, комбинирующую селективную оценку ИИ и адаптивную эскалацию к человеку; SCALE корректна при конечных размерах выборки, аппроксимирует границу в первом порядке при стремлении целевых вероятностей ошибок к нулю и расширяется с помощью пилотных данных AI–human.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В препринте на arXiv (arXiv:2609.28859v1) рассматривается использование оценок ИИ вместе с избирательной проверкой людьми для проведения корректных статистических тестов при контроле ошибок I и II рода и минимальных затратах.
  2. Авторы выводят информационно‑теоретическую нижнюю границу затрат, описывают зависимый от отчёта информационный фронтир и представляют SCALE — последовательную политику, комбинирующую селективную оценку ИИ и адаптивную эскалацию к человеку; SCALE корректна при конечных размерах выборки, аппроксимирует границу в первом порядке при стремлении целевых вероятностей ошибок к нулю и расширяется с помощью пилотных данных AI–human.
  3. Предлагает обоснованную, экономно‑ориентированную схему и близкую к оптимальной последовательную политику для сочетания дешёвых оценок ИИ с избирательной проверкой людьми, обеспечивая корректную статистическую интерпретацию.

ПОЧЕМУ ЭТО ВАЖНО

Предлагает обоснованную, экономно‑ориентированную схему и близкую к оптимальной последовательную политику для сочетания дешёвых оценок ИИ с избирательной проверкой людьми, обеспечивая корректную статистическую интерпретацию.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1