НОВОСТЬ · RESEARCH · #350
Триаж рисков источников с учётом запроса для RAG (arXiv:2609.16564v1)
В работе предложен предгенерационный слой триажа для генерации с извлечениями, учитывающий зависимость отношения источника к конкретному запросу: метод распределяет канонические семейства запросов и помечает найденные страницы как пропустить, контекстуализировать, исключить или отправить на проверку. Подход сочетает четырёхмерную оценку страниц, ранжированную агрегaцию по семействам, мутации запросов без изменения намерения и роутер с удержанием семейства, откалиброванный на пилоте из 200 URL и проверенный на синтетическом сценарии из 20 000 строк с «oracle page gate», причём отмечены ограничения аннотационной надёжности и отсутствия живой динамики поиска.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В работе предложен предгенерационный слой триажа для генерации с извлечениями, учитывающий зависимость отношения источника к конкретному запросу: метод распределяет канонические семейства запросов и помечает найденные страницы как пропустить, контекстуализировать, исключить или отправить на проверку.
- Подход сочетает четырёхмерную оценку страниц, ранжированную агрегaцию по семействам, мутации запросов без изменения намерения и роутер с удержанием семейства, откалиброванный на пилоте из 200 URL и проверенный на синтетическом сценарии из 20 000 строк с «oracle page gate», причём отмечены ограничения аннотационной надёжности и отсутствия живой динамики поиска.
- Метод вводит аудитируемый, зависящий от запроса механизм для приоритизации проверки источников в RAG-пайплайнах, что важно для более безопасных и точных рабочих процессов проверки.
ПОЧЕМУ ЭТО ВАЖНО
Метод вводит аудитируемый, зависящий от запроса механизм для приоритизации проверки источников в RAG-пайплайнах, что важно для более безопасных и точных рабочих процессов проверки.