РЕЛИЗ · MODELS · #875
Google выпустила модели TTS Gemini 3.8 Flash и Flash‑Lite
Google представила две новые модели синтеза речи Gemini 3.8 — Flash TTS для выразительных, персонажно‑ориентированных голосов и Flash‑Lite TTS для масштабного и экономичного использования — доступные в Google AI Studio, через Gemini API/Enterprise, в Gemini Notebook и Google Vids. Модели предлагают большую библиотеку голосов (более 2000 готовых голосов, свыше 100 языков/диалектов), создание голосов по текстовым подсказкам, воссоздание голоса по 30‑секундному образцу с проверкой согласия, защиту через SynthID и C2PA, а также поддержку долгих и многоголосых сцен.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Google представила две новые модели синтеза речи Gemini 3.8 — Flash TTS для выразительных, персонажно‑ориентированных голосов и Flash‑Lite TTS для масштабного и экономичного использования — доступные в Google AI Studio, через Gemini API/Enterprise, в Gemini Notebook и Google Vids.
- Модели предлагают большую библиотеку голосов (более 2000 готовых голосов, свыше 100 языков/диалектов), создание голосов по текстовым подсказкам, воссоздание голоса по 30‑секундному образцу с проверкой согласия, защиту через SynthID и C2PA, а также поддержку долгих и многоголосых сцен.
- Релиз расширяет возможности генеративного звука для создателей и компаний — позволяя создавать кастомные, длительные и многоголосые аудиопроекты в масштабе, одновременно подчёркивая меры по верификации согласия и происхождения голоса.
БРИФ ДЛЯ РЕШЕНИЙ
УВЕРЕННОСТЬ
ЧТО ИЗМЕНИЛОСЬ
Google объявила о двух новых моделях синтеза речи Gemini 3.8: Gemini 3.8 Flash TTS (выразительная, ориентированная на персонажей) и Gemini 3.8 Flash‑Lite TTS (экономичная, для массового использования).
ПОЧЕМУ СЕЙЧАС
Релиз расширяет аудиовозможности Gemini: появилось генеративное проектирование голосов, большая библиотека готовых голосов, поддержка многоголосных и длинных сцен — с акцентом на масштабирование выразительного звука для создателей, разработчиков и предприятий.
КОГО ЗАТРАГИВАЕТ
Непосредственно затронуты: создатели и креативные команды (игры, аудиокниги, подкасты), разработчики голосовых продуктов, команды дубляжа и массового производства аудио, а также предприятия, использующие продукты Gemini (Gemini API, Google AI Studio, Gemini Notebook, Google Vids согласно сообщениям вендора).
ПОДТВЕРЖДЕНО
Все нижеуказанные пункты прямо указаны в предоставленных отрывках источников: - Google представила две модели TTS Gemini 3.8: Flash TTS и Flash‑Lite TTS (IDs: 1035, 1036, 1048). - Flash TTS описана как предназначенная для глубокой креативной постановки и дизайна персонажей; Flash‑Lite TTS — оптимизирована для массового, экономичного использования (IDs: 1035, 1036, 1048). - Модели поддерживают генеративное создание голосов из текстовых подсказок и управление ролью, акцентом, темпом и выразительными нюансами более чем на 100 языках/диалектах (IDs: 1035, 1036, 1048). - Google указывает обширную библиотеку из более чем 2000 производственных голосов и региональные варианты, например мексиканский испанский, кебекский французский и шотландский английский (IDs: 1035, 1036, 1048). - Модели включают функции постановки многоголосых сцен, инструкции по строкам и невокальные звуки (IDs: 1035, 1036, 1048). - Описана функция клонирования/воспроизведения голоса на основе примерно 30‑секундного образца, требующая записанного заявления о согласии, совпадающего с образцом (ID: 1048). - Вендорные публикации Google/DeepMind указывают доступность через Google AI Studio, Gemini API, Gemini Notebook и Google Vids (IDs: 1035, 1036).
НЕОПРЕДЕЛЁННОСТЬ
Отсутствующие или противоречивые данные (явно помечено): - Противоречие по поводу немедленной доступности для предприятий/API: публикации вендора (IDs: 1035, 1036) указывают на доступность через Gemini API и Gemini Enterprise, тогда как The Decoder (ID: 1048) сообщает о развёртывании через Gemini API и Google AI Studio и говорит, что доступ к Enterprise API последует позже. В предоставленных отрывках это противоречие не разрешено. - C2PA‑учётные данные: в отрывках прямо упоминается inaudible SynthID‑водяной знак в сгенерированных клипах (ID: 1048), но в отрывках нет явного подтверждения использования C2PA; наличие/статус C2PA в этих моделях в предоставленных отрывках не показан. - Оперативные детали не содержатся в отрывках: цены, ограничения по скорости, задержки, SDK/обновления SDK, точный процесс проверки согласия, меры против злоупотреблений помимо SynthID и измеряемая надёжность генерации длинных форм и «дрейфа» голоса не документируются в предоставленных отрывках. - Реальное качество/покрытие по всем заявленным языкам и диалектам и эмпирическая производительность 30‑секундного клонирования в разных условиях аудио не подтверждены в источниках.
ЧТО ОТСЛЕЖИВАТЬ
Конкретные наблюдаемые сигналы для отслеживания (где смотреть в каналах вендора/прессы): - Официальные страницы продуктов Gemini, объявления Gemini API / Gemini Enterprise для прояснения доступности для предприятий/API и сроков развёртывания (IDs: 1035, 1036, 1048). - Документация Google AI Studio / Gemini Notebook / Google Vids и журналы изменений для деталей интеграции, демо и поддерживаемых рабочих процессов (IDs: 1035, 1036). - Примечания к релизу или обновления блога с упоминанием доступности Voice Remixing и любых изменений в процессе клонирования голоса на 30 секунд или проверке согласия (ID: 1048). - Технические документы или страницы по безопасности/конфиденциальности с описанием реализации SynthID и возможным упоминанием C2PA или инструментов происхождения (ID: 1048). - Независимые демонстрации, технические оценки или репортажи СМИ, показывающие стабильность длинных форм, метрики дрейфа голоса и качество между языками (для подтверждения утверждений в IDs: 1035, 1036, 1048).
ПОЧЕМУ ЭТО ВАЖНО
Релиз расширяет возможности генеративного звука для создателей и компаний — позволяя создавать кастомные, длительные и многоголосые аудиопроекты в масштабе, одновременно подчёркивая меры по верификации согласия и происхождения голоса.
КАРТА ДОКАЗАТЕЛЬСТВ
4Редакционные тезисы связаны с конкретными источниками. Отдельно отмечены подтверждения, противоречия и контекст.
Google представила две новые текст‑в‑речь модели Gemini 3.8: Flash TTS и Flash‑Lite TTS.
ПОДТВЕРЖДЕНОПроверено 2026-09-24 · 3 подтверждений
Блог Google называет и описывает Gemini 3.8 Flash TTS и Flash‑Lite TTS.
ПОДТВЕРЖДАЕТ Google DeepMindMEDIA · 2026-09-24Блог DeepMind дублирует объявление о продуктах.
ПОДТВЕРЖДАЕТ The DecoderMEDIA · 2026-09-24Статья СМИ сообщает о тех же двух моделях и описывает их назначение.
Flash TTS позиционируется для выразительного, персонажно‑ориентированного дизайна голоса; Flash‑Lite TTS — для масштабного и экономичного использования.
ПОДТВЕРЖДЕНОПроверено 2026-09-24 · 3 подтверждений
Пост Google прямо характеризует Flash TTS для глубокой творческой дирекции, а Flash‑Lite — для масштабного и экономичного использования.
ПОДТВЕРЖДАЕТ Google DeepMindMEDIA · 2026-09-24Пост DeepMind повторяет то же позиционирование продукта.
ПОДТВЕРЖДАЕТ The DecoderMEDIA · 2026-09-24Статья The Decoder приводит те же различия между Flash и Flash‑Lite.
В публикациях Google говорится, что модели доступны через Google AI Studio, Gemini API/Enterprise, Gemini Notebook и Google Vids.
ПОДТВЕРЖДЕНОПроверено 2026-09-24 · 2 подтверждений
Блог Google перечисляет Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook и Google Vids как среды развёртывания.
ПОДТВЕРЖДАЕТ Google DeepMindMEDIA · 2026-09-24Пост DeepMind повторяет тот же список доступности.
КОНТЕКСТ The DecoderMEDIA · 2026-09-24The Decoder отмечает развёртывание через Gemini API и Google AI Studio и указывает, что доступ через Gemini Enterprise API последует позже — то есть в материале говорится о поэтапном запуске.
В публикациях говорится, что модели поддерживают свыше 100 языков и диалектов и позволяют генерировать голоса по текстовым подсказкам.
ПОДТВЕРЖДЕНОПроверено 2026-09-24 · 3 подтверждений
Пост Google говорит, что Flash TTS позволяет настраивать роль, акцент и голосовые характеристики более чем для 100 языков и диалектов с помощью текстовых подсказок.
ПОДТВЕРЖДАЕТ Google DeepMindMEDIA · 2026-09-24Пост DeepMind повторяет утверждения о мультиязычности и генерации по подсказкам.
ПОДТВЕРЖДАЕТ The DecoderMEDIA · 2026-09-24Статья The Decoder также сообщает о поддержке более чем 100 языков.
ИСТОЧНИКИ И ХРОНОЛОГИЯ
3Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS are our most expressive audio generation models yet. Generate custom character voices and direct scene dialogue across Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, and Google Vids. Director, Research Science, on Behalf of the Gemini Audio Team Today, we’re introducing two new text-to-speech models to the Gemini family, transforming voice genera…
Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS are our most expressive audio generation models yet. Generate custom character voices and direct scene dialogue across Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, and Google Vids. Director, Research Science, on Behalf of the Gemini Audio Team Today, we’re introducing two new text-to-speech models to the Gemini family, transforming voice genera…
Gemini 3.8 Live with Live Avatar brings real-time visual presence to Gemini’s conversational AI. By natively coupling our live dialogue capabilities with low-latency streaming video, Live Avatar enables a more natural and intuitive conversational experience for enterprises and their users. Software Engineer, on behalf of the Gemini Audio Team Building on the momentum of last week's Gemini 3.8 Live launch, today we …
Gemini 3.8 Live with Live Avatar brings real-time visual presence to Gemini’s conversational AI. By natively coupling our live dialogue capabilities with low-latency streaming video, Live Avatar enables a more natural and intuitive conversational experience for enterprises and their users. Software Engineer, on behalf of the Gemini Audio Team Building on the momentum of last week's Gemini 3.8 Live launch, today we …
Google has released two new text-to-speech models, Gemini 3.8 Flash TTS and Flash-Lite TTS, which support more than 100 languages. Flash TTS can create new voices from text descriptions, and a voice cloning feature builds voice profiles from 30-second audio samples. Flash TTS is aimed at creative uses such as podcasts, audiobooks, and game characters, while Flash-Lite TTS is designed for low-cost speech generation a…