Не установлено по доступным источникам.
GOOGLE (DEEPMIND) · ТРЕКЕР МОДЕЛИ
Gemini 3.8 Flash TTS
Gemini 3.8 Flash TTS — модель синтеза речи, анонсированная Google в сентябре 2026 года. Предназначена для креативного дизайна голосов и выразительной генерации аудио — создание уникальных голосов по текстовым подсказкам, управление исполнением по строчкам, поддержка многих языков и диалоговых функций, интеграция с Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook и Google Vids.ТЕКУЩИЙ СНИМОК1/5 РАЗДЕЛОВ С ДАННЫМИ
Главные характеристики в одном месте.
Не установлено по доступным источникам.
Не установлено по доступным источникам.
Не установлено по доступным источникам.
ХРОНОЛОГИЯ РЕЛИЗОВ
Только опубликованные события с источниками.
Google DeepMind представила Gemini 4 Argon — фронтирную модель с контекстом в 1M токенов
Google DeepMind объявила о модели Gemini 4 Argon — фронтирной мультимодальной модели, заточенной под долгие последовательные рассуждения и сложные рабочие процессы. Argon сначала разворачивается у доверенных киберзащитников в рамках программы Fairwind, увеличивает предел контекста до 1 миллиона токенов, демонстрирует лидирующие результаты по ряду бенчмарков (кодирование, финансы, право, анализ видео) и будет расширенно доступен после поэтапного тестирования безопасности и взаимодействия с органами власти США; также объявлены вводные тарифы.
Google выпустила модели TTS Gemini 3.8 Flash и Flash‑Lite
Google представила две новые модели синтеза речи Gemini 3.8 — Flash TTS для выразительных, персонажно‑ориентированных голосов и Flash‑Lite TTS для масштабного и экономичного использования — доступные в Google AI Studio, через Gemini API/Enterprise, в Gemini Notebook и Google Vids. Модели предлагают большую библиотеку голосов (более 2000 готовых голосов, свыше 100 языков/диалектов), создание голосов по текстовым подсказкам, воссоздание голоса по 30‑секундному образцу с проверкой согласия, защиту через SynthID и C2PA, а также поддержку долгих и многоголосых сцен.
ПРОВЕРЯЕМЫЕ ФАКТЫ
Каждое значение привязано к источнику и дате.
Анонсирована Google 2026-09-23.
Модель синтеза речи (генерация аудио).
Может создавать полностью новые голоса по текстовым подсказкам с тонкой настройкой роли, акцента, актёрских подсказок, темпа, диалектных сдвигов и обратных сигналов.
Поддерживает более 100 языков и диалектов.
Поддерживает режиссёрские указания для каждой строки, двухголосный диалог и невербальные звуки (например, смех, вздохи).
Имеется функция клонирования голоса, которая может создать профиль голоса из 30‑секундного аудиофрагмента.
Предоставляет большую библиотеку пресетов (сообщается >2 000 голосов) и возможность масштабирования от ограниченного набора к практически неограниченному числу оригинальных голосов.
Google утверждает, что модель может генерировать часы аудио с минимальным «дрейфом говорящего» (голос почти не меняется со временем).
ЧТО ИЗМЕНИЛОСЬ