Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · RESEARCH · #350

Триаж рисков источников с учётом запроса для RAG (arXiv:2609.16564v1)

В работе предложен предгенерационный слой триажа для генерации с извлечениями, учитывающий зависимость отношения источника к конкретному запросу: метод распределяет канонические семейства запросов и помечает найденные страницы как пропустить, контекстуализировать, исключить или отправить на проверку. Подход сочетает четырёхмерную оценку страниц, ранжированную агрегaцию по семействам, мутации запросов без изменения намерения и роутер с удержанием семейства, откалиброванный на пилоте из 200 URL и проверенный на синтетическом сценарии из 20 000 строк с «oracle page gate», причём отмечены ограничения аннотационной надёжности и отсутствия живой динамики поиска.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В работе предложен предгенерационный слой триажа для генерации с извлечениями, учитывающий зависимость отношения источника к конкретному запросу: метод распределяет канонические семейства запросов и помечает найденные страницы как пропустить, контекстуализировать, исключить или отправить на проверку.
  2. Подход сочетает четырёхмерную оценку страниц, ранжированную агрегaцию по семействам, мутации запросов без изменения намерения и роутер с удержанием семейства, откалиброванный на пилоте из 200 URL и проверенный на синтетическом сценарии из 20 000 строк с «oracle page gate», причём отмечены ограничения аннотационной надёжности и отсутствия живой динамики поиска.
  3. Метод вводит аудитируемый, зависящий от запроса механизм для приоритизации проверки источников в RAG-пайплайнах, что важно для более безопасных и точных рабочих процессов проверки.

ПОЧЕМУ ЭТО ВАЖНО

Метод вводит аудитируемый, зависящий от запроса механизм для приоритизации проверки источников в RAG-пайплайнах, что важно для более безопасных и точных рабочих процессов проверки.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1