НОВОСТЬ · RESEARCH · #354
Оценка агентных навыков для задач анализа данных в реальном времени (ground-truth-as-code, arXiv:2609.16487v1)
В статье предлагается методика оценки агентов по анализу данных на живых, постоянно обновляющихся данных: ожидаемые ответы кодируются как исполняемые эталоны ('ground-truth-as-code'), которые пересчитывают ответ из текущих данных во время оценки, а формат-независимый фактойдовый судья разбивает ответы на атомарные утверждения и оценивает точность, полноту и корректность. На внутреннем эксперименте с синтетической базой данных метод показал улучшение согласия с экспертами (MCC +29% против естественно-языкового эталона) и снижение потребления токенов на 16%; предложенный подход применим к агентам, работающим с мульти‑источниками и нестационарными данными.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье предлагается методика оценки агентов по анализу данных на живых, постоянно обновляющихся данных: ожидаемые ответы кодируются как исполняемые эталоны ('ground-truth-as-code'), которые пересчитывают ответ из текущих данных во время оценки, а формат-независимый фактойдовый судья разбивает ответы на атомарные утверждения и оценивает точность, полноту и корректность.
- На внутреннем эксперименте с синтетической базой данных метод показал улучшение согласия с экспертами (MCC +29% против естественно-языкового эталона) и снижение потребления токенов на 16%; предложенный подход применим к агентам, работающим с мульти‑источниками и нестационарными данными.
- Метод закрывает практический пробел в оценке агентов, работающих с нестационарными данными, делая эталоны исполняемыми и формат‑независимыми и повышая автоматическое согласие с человеческой оценкой.
ПОЧЕМУ ЭТО ВАЖНО
Метод закрывает практический пробел в оценке агентов, работающих с нестационарными данными, делая эталоны исполняемыми и формат‑независимыми и повышая автоматическое согласие с человеческой оценкой.