Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · RESEARCH · #354

Оценка агентных навыков для задач анализа данных в реальном времени (ground-truth-as-code, arXiv:2609.16487v1)

В статье предлагается методика оценки агентов по анализу данных на живых, постоянно обновляющихся данных: ожидаемые ответы кодируются как исполняемые эталоны ('ground-truth-as-code'), которые пересчитывают ответ из текущих данных во время оценки, а формат-независимый фактойдовый судья разбивает ответы на атомарные утверждения и оценивает точность, полноту и корректность. На внутреннем эксперименте с синтетической базой данных метод показал улучшение согласия с экспертами (MCC +29% против естественно-языкового эталона) и снижение потребления токенов на 16%; предложенный подход применим к агентам, работающим с мульти‑источниками и нестационарными данными.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье предлагается методика оценки агентов по анализу данных на живых, постоянно обновляющихся данных: ожидаемые ответы кодируются как исполняемые эталоны ('ground-truth-as-code'), которые пересчитывают ответ из текущих данных во время оценки, а формат-независимый фактойдовый судья разбивает ответы на атомарные утверждения и оценивает точность, полноту и корректность.
  2. На внутреннем эксперименте с синтетической базой данных метод показал улучшение согласия с экспертами (MCC +29% против естественно-языкового эталона) и снижение потребления токенов на 16%; предложенный подход применим к агентам, работающим с мульти‑источниками и нестационарными данными.
  3. Метод закрывает практический пробел в оценке агентов, работающих с нестационарными данными, делая эталоны исполняемыми и формат‑независимыми и повышая автоматическое согласие с человеческой оценкой.

ПОЧЕМУ ЭТО ВАЖНО

Метод закрывает практический пробел в оценке агентов, работающих с нестационарными данными, делая эталоны исполняемыми и формат‑независимыми и повышая автоматическое согласие с человеческой оценкой.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1