GOOGLE / GOOGLE DEEPMIND · ТРЕКЕР МОДЕЛИ
Gemini 3.8 Live
Gemini 3.8 Live — модель живого диалога из семейства Gemini, созданная для почти реального времени при голосовом взаимодействии: она может обрабатывать визуальные входы, выполнять фоновые вызовы инструментов и масштабироваться для голосовых агентов. Вариант Live Avatar добавляет низколатентную генерацию видео с синхронизацией губ и выражениями и предлагается корпоративным клиентам.ТЕКУЩИЙ СНИМОК5/5 РАЗДЕЛОВ С ДАННЫМИ
Главные характеристики в одном месте.
ХРОНОЛОГИЯ РЕЛИЗОВ
Только опубликованные события с источниками.
Google DeepMind представила Gemini 4 Argon — фронтирную модель с контекстом в 1M токенов
Google DeepMind объявила о модели Gemini 4 Argon — фронтирной мультимодальной модели, заточенной под долгие последовательные рассуждения и сложные рабочие процессы. Argon сначала разворачивается у доверенных киберзащитников в рамках программы Fairwind, увеличивает предел контекста до 1 миллиона токенов, демонстрирует лидирующие результаты по ряду бенчмарков (кодирование, финансы, право, анализ видео) и будет расширенно доступен после поэтапного тестирования безопасности и взаимодействия с органами власти США; также объявлены вводные тарифы.
Google выпустила модели TTS Gemini 3.8 Flash и Flash‑Lite
Google представила две новые модели синтеза речи Gemini 3.8 — Flash TTS для выразительных, персонажно‑ориентированных голосов и Flash‑Lite TTS для масштабного и экономичного использования — доступные в Google AI Studio, через Gemini API/Enterprise, в Gemini Notebook и Google Vids. Модели предлагают большую библиотеку голосов (более 2000 готовых голосов, свыше 100 языков/диалектов), создание голосов по текстовым подсказкам, воссоздание голоса по 30‑секундному образцу с проверкой согласия, защиту через SynthID и C2PA, а также поддержку долгих и многоголосых сцен.
ПРОВЕРЯЕМЫЕ ФАКТЫ
Каждое значение привязано к источнику и дате.
131 072 входных токена
65 536 выходных токенов
Аудио с необязательной текстовой расшифровкой; формат ответа Live API — аудио
2026-09-15
$0.75 USD / 1 млн входных токенов (текстовых); платный стандартный Live API
$4.5 USD / 1 млн выходных токенов (текстовых); платный стандартный Live API
$3 USD / 1 млн входных токенов (аудио); платный стандартный Live API
$12 USD / 1 млн выходных токенов (аудио); платный стандартный Live API
$1 USD / 1 млн входных токенов (изображения/видео); платный стандартный Live API
Анонсирована как новая модель живого диалога 2026-09-15 (вместе с Gemini 3.8 Live Extended Thinking).
Обрабатывает визуальные входы почти в реальном времени для обогащения диалогов и визуального контекстирования.
Поддерживает асинхронные вызовы функций: может выполнять вызовы API и инструментов в фоновом режиме, продолжая одновременно передавать аудиответы пользователю.
Живой диалог в near‑real‑time (speech‑to‑speech) с поддержкой обработки визуальных входов (визуальное контекстирование) в ходе разговора.
Доступна разработчикам через Live API и Google AI Studio; доступна на платформе Gemini Enterprise Agent. Функция Live Avatar (near‑real‑time видео + речь) доступна в Gemini Enterprise.
Gemini 3.8 Live доступна разработчикам через Gemini API / Live API и Google AI Studio.
Указанное ценообразование Live API: $0.005 за минуту аудио-входа и $0.018 за минуту аудио-выхода (сообщается в заметке для разработчиков).
Сообщается о высокой пользовательской предпочтительности, заняла второе место в Speech Agent Arena (указано в анонсе).
Поддерживает асинхронные/фоновые вызовы функций и инструментов (выполнение API/инструментов при одновременной подаче аудио-ответов), алфавитно‑цифровую точность (точный разбор кодов/чисел), автоматическое определение/переключение языков (указана поддержка ~97 языков), поэтапные обновления содержания и сохранение диалога при выполнении задач.
Gemini 3.8 Live показала высокий пользовательский приоритет, заняв второе место в «Speech Agent Arena» (сообщается в публикациях Google/DeepMind о запуске 3.8 Live).
В бенчмарке VAmoS по голосовым агентам лидировал Grok Voice; Gemini 3.8 Live и GPT‑Live шли следом, при этом у Gemini 3.8 Live указана схожая стоимость за звонок с GPT‑Live (результаты VAmoS).
В оценке VAmoS наличие фонового телевещания значительно снизило суммарную успешность выполнения задач (с 38.7% до 8.6%), что указывает на высокую чувствительность производительности голосовых агентов (включая стеки, тестировавшиеся с Gemini 3.8 Live) к конкурирующей фоновой речи/шуму.
ЧТО ИЗМЕНИЛОСЬ