Tech Meridian ← К СУЩНОСТЯМ
EN

ТЕМА · ENTITY #410

arXiv

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

9

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья на arXiv предлагает «Collaborative Memory» для мультиагентных VLM-систем

Новый препринт на arXiv (arXiv:2609.17921v1) описывает иерархию памяти и механизмы совместного обмена для агентов vision-language model (VLM), утверждая, что общая визуальная память должна сохранять наблюдения, интерпретации агентов, зависимости и обновления, чтобы команда могла восстанавливать недостающий контекст и согласовывать разные интерпретации. В работе предлагаются соображения по дизайну потоков информации и согласованности в командах агентов для повышения надёжности и эффективности распределённого визуального восприятия и рассуждений.

6.0

RESEARCH · 1 ИСТОЧН. · Cohere

Препринт Cohere Labs: в пайплайнах LLM выявлен «культурный фильтр», опубликован набор данных CultureMarkers

Cohere Labs проанализировала более 5,6 млн образцов данных из этапов предобучения, SFT, выравнивания и reasoning и сообщает о постоянной тенденции — «культурном фильтре», когда культурное разнообразие сужается на пост-тренировочных этапах. Команда использовала модель Command A для автоматической разметки культурных сигналов, утверждает, что одной мультиязычности недостаточно для представления культуры, и опубликовала препринт на arXiv и набор данных CultureMarkers на Hugging Face.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

TimeThink: синтетическая схема и RLVR для выработки композиционного рассуждения в временных LLM

Авторы предлагают TimeThink — синтетическую схему, которая генерирует детерминированные атомарные и составные пары вопрос–ответ с трассировками рассуждений для временных мультимодальных LLM. В сочетании со стратегией обучения «reinforcement learning with verifiable rewards» (RLVR) метод поощряет явные композиционные временные рассуждения; в статье сообщается, что модели, обученные только на синтетических данных, превосходят сильные базовые подходы на синтетических и некоторых реальных наборах данных.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

GAVEL: протокол вынесения вердикта на основе LLM для сравнения и слияния клинических хронологий из клинических отчетов

Авторы представляют GAVEL — протокол на основе LLM, который сравнивает две извлеченные клинические хронологии с исходным клиническим отчетом и возвращает для каждой разницы тип несоответствия, вердикт и фрагмент отчета. В работе оценивают сопоставитель событий и анализируют 2 738 выводов от GPT5.6sol и DeepSeek V3.2, ранжируют шесть извлекателей на базе LLM и двух человеческих аннотаторов, а также тестируют слияние под управлением GAVEL: по 126 отчетам объединенные хронологии предпочитали в 77,0% сравнений, несоответствия, приписываемые проверяемой хронологии, сократились с 7.63 до 0.85 на отчет; ручная проверка подтвердила 89.4% и 88.6% выводов, истинные показатели совпадения составили 60% сразу ниже и 48% сразу выше порога 0.10.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

OdoBot: Эффективная по токенам архитектура веб‑агента на основе моделирования поведения приложения

В препринте на arXiv представлена OdoBot — архитектура веб‑агента, которая строит модель поведения приложения на основе примеров успешного выполнения задач для сокращения потребления токенов. В экспериментах на 45 задачах в Canvas LMS OdoBot использовал на 44% и 80% меньше токенов по сравнению с Agent-E и WebVoyager соответственно и превзошёл WebVoyager по показателю успешности задач.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

От юридического текста к источникам рисков ИИ: системный анализ требований к высокорисковым системам в Законе ЕС об ИИ (препринт на arXiv)

Авторы проводят системную классификацию требований Раздела 2 Закона ЕС об ИИ (требования к высокорисковым системам) и выявляют, что лишь меньшинство требований непосредственно охватывают специфические риски ИИ, тогда как большинство накладывает организационные/процессные и документационные обязательства. Из требований, связанных с рисками ИИ, они формируют сводный «Список источников рисков по Закону ЕС об ИИ» для сопоставления охвата рисков Законом с существующими таксономиями рисков; это препринт авторов, представленный на упомянутой конференции.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Asclepius: адаптивная оболочка для долговременных клинических агентов на основе LLM

В статье на arXiv исследуются ошибки исполнения LLM-агентов в долгих сценариях в симуляторе клинической среды (CES) и выделяются три взаимосвязанных режима сбоев: дрейф соблюдения инструкций, неполнота лечения и разрыв по своевременности в зависимости от тяжести. Авторы предлагают Asclepius — каркас с самообновляемой «операционной инструкцией», внешней библиотекой клинических навыков и тремя субагентами; на отложенных батчах он улучшает корректность критических действий на 22% (p = 0.024), а на полном наборе — до 25% по критическим действиям и 13% по своевременности, при сохранении точности диагноза.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

AutoTailor: автоматический, ориентированный на пользователя отбор и адаптация возможностей веб-агентов

AutoTailor — метаагентная структура, которая переводит траектории взаимодействия с вебом в параметризованные API для автоматизации браузера, применяет офлайн-фильтры качества и вероятности использования для удаления избыточных или малоценных API и использует онлайн-Dynamic Reselection для добавления недостающих возможностей и удаления постоянно неиспользуемых. На 106 задачах WebArena Postmill офлайн-фильтрация сократила 1 283 начальных API до 87, а Dynamic Reselection дал набор из 33 API; с откатом на ReAct этот набор показал точность 90,6% (против 87,5% у одного ReAct), снизив затраты на токены запросов на 57,8% и задержку на 29,4%, а без ReAct достижение точности составило 60,1% при сокращении использования токенов запросов на 94,9%.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Маршрутизация с учётом углеродного следа для вызова функций в распределённых LLM-системах (edge‑cloud)

В статье на arXiv предложена схема маршрутизации с учётом углеродного следа, которая распределяет запросы на вызов функций по трёхуровневой edge‑cloud архитектуре, используя LLM на периферии и в облаке. Лёгкий k‑NN предсказатель в едином семантико‑лексическом пространстве оценивает для каждого запроса точность, задержку и потребляемую мощность и, учитывая текущую углеродную интенсивность сети, направляет запрос на наименее углеродоёмкий уровень; в оценках заявлено сопоставимое с облаком качество при снижении выбросов примерно в 4× в среднем.

7.0