Tencent представила Gander — мультимодального агента в реальном времени с «мозжечком» и сменным «мозгом»
Исследователи Tencent представили Gander — мультимодальную исследовательскую модель, которая непрерывно обрабатывает речь, изображение и текст и разделяет роли на низколатентный разговорный «мозжечок» и сменный рассуждающий «мозг» для сложных агентных задач. Команда сообщает о высокой точности по времени на Full-Duplex-Bench v3, отмечает отставание по точности задач и проблемы с восприятием аудио/видео в некоторых тестах, опубликовала код на GitHub и демонстрации и планирует выпустить веса модели и данные обучения.