Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

РЕЛИЗ · MODELS · #696

Tencent представила Gander — мультимодального агента в реальном времени с «мозжечком» и сменным «мозгом»

Исследователи Tencent представили Gander — мультимодальную исследовательскую модель, которая непрерывно обрабатывает речь, изображение и текст и разделяет роли на низколатентный разговорный «мозжечок» и сменный рассуждающий «мозг» для сложных агентных задач. Команда сообщает о высокой точности по времени на Full-Duplex-Bench v3, отмечает отставание по точности задач и проблемы с восприятием аудио/видео в некоторых тестах, опубликовала код на GitHub и демонстрации и планирует выпустить веса модели и данные обучения.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Исследователи Tencent представили Gander — мультимодальную исследовательскую модель, которая непрерывно обрабатывает речь, изображение и текст и разделяет роли на низколатентный разговорный «мозжечок» и сменный рассуждающий «мозг» для сложных агентных задач.
  2. Команда сообщает о высокой точности по времени на Full-Duplex-Bench v3, отмечает отставание по точности задач и проблемы с восприятием аудио/видео в некоторых тестах, опубликовала код на GitHub и демонстрации и планирует выпустить веса модели и данные обучения.
  3. Разделённая архитектура Gander и планируемый открытый релиз могут повлиять на разработку и оценку реального времени диалоговых агентов, открыв возможности для исследований низкой латентности и отдельной модуляции рассуждений.

ПОЧЕМУ ЭТО ВАЖНО

Разделённая архитектура Gander и планируемый открытый релиз могут повлиять на разработку и оценку реального времени диалоговых агентов, открыв возможности для исследований низкой латентности и отдельной модуляции рассуждений.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1