Tech Meridian← ВСЕ МОДЕЛИ
PROМОЙ MERIDIAN

GOOGLE / GOOGLE DEEPMIND · ТРЕКЕР МОДЕЛИ

Gemini 3.8 Live

Gemini 3.8 Live — модель живого диалога из семейства Gemini, созданная для почти реального времени при голосовом взаимодействии: она может обрабатывать визуальные входы, выполнять фоновые вызовы инструментов и масштабироваться для голосовых агентов. Вариант Live Avatar добавляет низколатентную генерацию видео с синхронизацией губ и выражениями и предлагается корпоративным клиентам.

ТЕКУЩИЙ СНИМОК5/5 РАЗДЕЛОВ С ДАННЫМИ

Главные характеристики в одном месте.

ЦЕНА
Цена входа — текст$0.75 USD / 1 млн входных токенов (текстовых); платный стандартный Live API
Цена выхода — текст$4.5 USD / 1 млн выходных токенов (текстовых); платный стандартный Live API
Цена входа — аудио$3 USD / 1 млн входных токенов (аудио); платный стандартный Live API
Цена выхода — аудио$12 USD / 1 млн выходных токенов (аудио); платный стандартный Live API
Цена входа — изображения/видео$1 USD / 1 млн входных токенов (изображения/видео); платный стандартный Live API
Ценообразование (Live API)Указанное ценообразование Live API: $0.005 за минуту аудио-входа и $0.018 за минуту аудио-выхода (сообщается в заметке для разработчиков).
КОНТЕКСТ
Лимит входных токенов131 072 входных токена
МОДАЛЬНОСТИ
Форматы ответаАудио с необязательной текстовой расшифровкой; формат ответа Live API — аудио
Обработка визуальных входовОбрабатывает визуальные входы почти в реальном времени для обогащения диалогов и визуального контекстирования.
МодальностиЖивой диалог в near‑real‑time (speech‑to‑speech) с поддержкой обработки визуальных входов (визуальное контекстирование) в ходе разговора.
БЕНЧМАРКИ
Бенчмарк предпочтений пользователейGemini 3.8 Live показала высокий пользовательский приоритет, заняв второе место в «Speech Agent Arena» (сообщается в публикациях Google/DeepMind о запуске 3.8 Live).
Упоминание в бенчмарке VAmoSВ бенчмарке VAmoS по голосовым агентам лидировал Grok Voice; Gemini 3.8 Live и GPT‑Live шли следом, при этом у Gemini 3.8 Live указана схожая стоимость за звонок с GPT‑Live (результаты VAmoS).
ДОСТУПНОСТЬ
ДоступностьДоступна разработчикам через Live API и Google AI Studio; доступна на платформе Gemini Enterprise Agent. Функция Live Avatar (near‑real‑time видео + речь) доступна в Gemini Enterprise.
Доступность для разработчиковGemini 3.8 Live доступна разработчикам через Gemini API / Live API и Google AI Studio.

ХРОНОЛОГИЯ РЕЛИЗОВ

Только опубликованные события с источниками.

ИСТОЧНИКОВ 5 · ВАЖНОСТЬ 9.0

Google DeepMind представила Gemini 4 Argon — фронтирную модель с контекстом в 1M токенов

Google DeepMind объявила о модели Gemini 4 Argon — фронтирной мультимодальной модели, заточенной под долгие последовательные рассуждения и сложные рабочие процессы. Argon сначала разворачивается у доверенных киберзащитников в рамках программы Fairwind, увеличивает предел контекста до 1 миллиона токенов, демонстрирует лидирующие результаты по ряду бенчмарков (кодирование, финансы, право, анализ видео) и будет расширенно доступен после поэтапного тестирования безопасности и взаимодействия с органами власти США; также объявлены вводные тарифы.

→
ИСТОЧНИКОВ 5 · ВАЖНОСТЬ 8.0

Google выпустила модели TTS Gemini 3.8 Flash и Flash‑Lite

Google представила две новые модели синтеза речи Gemini 3.8 — Flash TTS для выразительных, персонажно‑ориентированных голосов и Flash‑Lite TTS для масштабного и экономичного использования — доступные в Google AI Studio, через Gemini API/Enterprise, в Gemini Notebook и Google Vids. Модели предлагают большую библиотеку голосов (более 2000 готовых голосов, свыше 100 языков/диалектов), создание голосов по текстовым подсказкам, воссоздание голоса по 30‑секундному образцу с проверкой согласия, защиту через SynthID и C2PA, а также поддержку долгих и многоголосых сцен.

→

ПРОВЕРЯЕМЫЕ ФАКТЫ

Каждое значение привязано к источнику и дате.

ДРУГОЕ · Асинхронные вызовы инструментов / APIДАННЫЕ РАЗРАБОТЧИКА

Поддерживает асинхронные вызовы функций: может выполнять вызовы API и инструментов в фоновом режиме, продолжая одновременно передавать аудиответы пользователю.

МОДАЛЬНОСТИ · МодальностиДАННЫЕ РАЗРАБОТЧИКА

Живой диалог в near‑real‑time (speech‑to‑speech) с поддержкой обработки визуальных входов (визуальное контекстирование) в ходе разговора.

ДОСТУПНОСТЬ · ДоступностьДАННЫЕ РАЗРАБОТЧИКА

Доступна разработчикам через Live API и Google AI Studio; доступна на платформе Gemini Enterprise Agent. Функция Live Avatar (near‑real‑time видео + речь) доступна в Gemini Enterprise.

ВОЗМОЖНОСТИ · Ключевые возможностиДАННЫЕ РАЗРАБОТЧИКА

Поддерживает асинхронные/фоновые вызовы функций и инструментов (выполнение API/инструментов при одновременной подаче аудио-ответов), алфавитно‑цифровую точность (точный разбор кодов/чисел), автоматическое определение/переключение языков (указана поддержка ~97 языков), поэтапные обновления содержания и сохранение диалога при выполнении задач.

БЕНЧМАРКИ · Бенчмарк предпочтений пользователейДАННЫЕ РАЗРАБОТЧИКА

Gemini 3.8 Live показала высокий пользовательский приоритет, заняв второе место в «Speech Agent Arena» (сообщается в публикациях Google/DeepMind о запуске 3.8 Live).

БЕНЧМАРКИ · Упоминание в бенчмарке VAmoSНЕЗАВИСИМО ПОДТВЕРЖДЕНО

В бенчмарке VAmoS по голосовым агентам лидировал Grok Voice; Gemini 3.8 Live и GPT‑Live шли следом, при этом у Gemini 3.8 Live указана схожая стоимость за звонок с GPT‑Live (результаты VAmoS).

ОГРАНИЧЕНИЯ · Чувствительность производительности к фоновому звуку (VAmoS)НЕЗАВИСИМО ПОДТВЕРЖДЕНО

В оценке VAmoS наличие фонового телевещания значительно снизило суммарную успешность выполнения задач (с 38.7% до 8.6%), что указывает на высокую чувствительность производительности голосовых агентов (включая стеки, тестировавшиеся с Gemini 3.8 Live) к конкурирующей фоновой речи/шуму.

ЧТО ИЗМЕНИЛОСЬ

Сохранённые версии паспорта, без догадок задним числом.

Паспорт обновлён21 фактов
МОДАЛЬНОСТИ · Мультимодальная (аудио + низколатентное видео)− В паре с Live Avatar объединяет почти реальное время генерации видео и речь, создавая опыт, который слушает, видит и говорит с динамичной визуальной персоной (точная синхронизация губ и естественные выражения).
ДОСТУПНОСТЬ · Доступность+ Доступна разработчикам через Live API и Google AI Studio; доступна на платформе Gemini Enterprise Agent. Функция Live Avatar (near‑real‑time видео + речь) доступна в Gemini Enterprise.
ВОЗМОЖНОСТИ · Ключевые возможности+ Поддерживает асинхронные/фоновые вызовы функций и инструментов (выполнение API/инструментов при одновременной подаче аудио-ответов), алфавитно‑цифровую точность (точный разбор кодов/чисел), автоматическое определение/переключение языков (указана поддержка ~97 языков), поэтапные обновления содержания и сохранение диалога при выполнении задач.
ЦЕНЫ · Ценообразование (Live API)Указанная цена Live API: $0.005 за минуту для аудиовхода и $0.018 за минуту для аудиовыхода.→Указанное ценообразование Live API: $0.005 за минуту аудио-входа и $0.018 за минуту аудио-выхода (сообщается в заметке для разработчиков).
ДОСТУПНОСТЬ · Доступность Live Avatar− Вариант Live Avatar (Gemini 3.8 Live with Live Avatar) доступен клиентам Gemini Enterprise (указано как доступный с сегодняшнего дня).
МОДАЛЬНОСТИ · Модальности+ Живой диалог в near‑real‑time (speech‑to‑speech) с поддержкой обработки визуальных входов (визуальное контекстирование) в ходе разговора.
ОГРАНИЧЕНИЯ · Чувствительность производительности к фоновому звуку (VAmoS)+ В оценке VAmoS наличие фонового телевещания значительно снизило суммарную успешность выполнения задач (с 38.7% до 8.6%), что указывает на высокую чувствительность производительности голосовых агентов (включая стеки, тестировавшиеся с Gemini 3.8 Live) к конкурирующей фоновой речи/шуму.
БЕНЧМАРКИ · Бенчмарк предпочтений пользователей+ Gemini 3.8 Live показала высокий пользовательский приоритет, заняв второе место в «Speech Agent Arena» (сообщается в публикациях Google/DeepMind о запуске 3.8 Live).
БЕНЧМАРКИ · Упоминание в бенчмарке VAmoS+ В бенчмарке VAmoS по голосовым агентам лидировал Grok Voice; Gemini 3.8 Live и GPT‑Live шли следом, при этом у Gemini 3.8 Live указана схожая стоимость за звонок с GPT‑Live (результаты VAmoS).
Паспорт обновлён17 фактов
ДОСТУПНОСТЬ · Доступность для разработчиковGemini 3.8 Live доступна разработчикам через Gemini API / Live API и Google AI Studio.→Gemini 3.8 Live доступна разработчикам через Gemini API / Live API и Google AI Studio.
ДРУГОЕ · Асинхронные вызовы инструментов / APIПоддерживает асинхронные вызовы функций: может выполнять вызовы API и инструментов в фоновом режиме, продолжая одновременно передавать аудиответы пользователю.→Поддерживает асинхронные вызовы функций: может выполнять вызовы API и инструментов в фоновом режиме, продолжая одновременно передавать аудиответы пользователю.
МОДАЛЬНОСТИ · Мультимодальная (аудио + низколатентное видео)В паре с Live Avatar объединяет почти реальное время генерации видео и речь, создавая опыт, который слушает, видит и говорит с динамичной визуальной персоной (точная синхронизация губ и естественные выражения).→В паре с Live Avatar объединяет почти реальное время генерации видео и речь, создавая опыт, который слушает, видит и говорит с динамичной визуальной персоной (точная синхронизация губ и естественные выражения).
КОНТЕКСТ · Лимит входных токенов+ 131 072 входных токена
РЕЛИЗ · Введение / выпускУточнены единицы или условия сравнения
ЦЕНЫ · Ценообразование (Live API, аудио)Указанная цена Live API: $0.005 за минуту для аудиовхода и $0.018 за минуту для аудиовыхода.→Указанная цена Live API: $0.005 за минуту для аудиовхода и $0.018 за минуту для аудиовыхода.
ДОСТУПНОСТЬ · Доступность Live AvatarВариант Live Avatar (Gemini 3.8 Live with Live Avatar) доступен клиентам Gemini Enterprise (указано как доступный с сегодняшнего дня).→Вариант Live Avatar (Gemini 3.8 Live with Live Avatar) доступен клиентам Gemini Enterprise (указано как доступный с сегодняшнего дня).
ВОЗМОЖНОСТИ · Максимальный ответ+ 65 536 выходных токенов
МОДАЛЬНОСТИ · Форматы ответа+ Аудио с необязательной текстовой расшифровкой; формат ответа Live API — аудио
ЦЕНЫ · Цена входа — аудио+ $3 USD / 1 млн входных токенов (аудио); платный стандартный Live API
ЦЕНЫ · Цена входа — изображения/видео+ $1 USD / 1 млн входных токенов (изображения/видео); платный стандартный Live API
ЦЕНЫ · Цена входа — текст+ $0.75 USD / 1 млн входных токенов (текстовых); платный стандартный Live API
ЦЕНЫ · Цена выхода — аудио+ $12 USD / 1 млн выходных токенов (аудио); платный стандартный Live API
ЦЕНЫ · Цена выхода — текст+ $4.5 USD / 1 млн выходных токенов (текстовых); платный стандартный Live API
РЕЛИЗ · Дата релиза+ 2026-09-15
ДРУГОЕ · Предпочтение пользователей / рейтингСообщается о высокой пользовательской предпочтительности, заняла второе место в Speech Agent Arena (указано в анонсе).→Сообщается о высокой пользовательской предпочтительности, заняла второе место в Speech Agent Arena (указано в анонсе).
МОДАЛЬНОСТИ · Обработка визуальных входовОбрабатывает визуальные входы почти в реальном времени для обогащения диалогов и визуального контекстирования.→Обрабатывает визуальные входы почти в реальном времени для обогащения диалогов и визуального контекстирования.
Паспорт создан8 фактов