Gemini 3.8 Flash TTS генерирует речь на 100+ языках с 2000 голосами и поддержкой диалогов
В Google AI Studio уже доступна генерация речи на базе Gemini 3.8 Flash TTS: вместе с флагманской моделью компания выпустила и более доступную версию Flash-Lite TTS. Обе модели рассчитаны на разные сценарии использования: Flash TTS делает ставку на качество, выразительность и гибкую настройку звучания, а Flash-Lite — на высокую скорость и массовую генерацию аудио.
Gemini 3.8 Flash TTS поддерживает 130 языков, а Flash-Lite — 101 язык, включая русский. Кроме того, пользователям доступна библиотека из более чем 2000 готовых голосов с различными языками, акцентами и региональными особенностями. При этом выбирать голос из готового списка необязательно: собственный голос можно создать с нуля с помощью текстового промпта, задав его характер, тембр, акцент и особенности подачи. Отдельно Google расширила возможности управления самой манерой речи. С помощью текстовых инструкций можно задавать темп, эмоциональную окраску, стиль исполнения и особенности произношения. В отдельных фрагментах поддерживаются и звуковые реакции вроде смеха, вздохов, кашля и пауз, благодаря чему синтезированная речь может звучать не как обычная озвучка текста, а как полноценное исполнение.
Модели также умеют работать с диалогами нескольких персонажей. Для каждой реплики можно отдельно задавать параметры исполнения, поэтому технология подходит для подкастов, аудиокниг, дубляжа, игровых персонажей и других проектов, где требуется взаимодействие нескольких голосов. Google отдельно отмечает улучшенную стабильность тембра и звучания при длинных многоходовых диалогах.
Ещё одна функция — репликация голоса. Google заявляет, что для создания копии достаточно 30-секундного образца, однако использовать можно только голос с разрешением его владельца: система предусматривает проверку согласия. Сгенерированное аудио также получает невидимую водяную метку SynthID, предназначенную для определения материалов, созданных ИИ.
При этом Flash-Lite ориентирована прежде всего на массовую и более дешёвую генерацию: её Google позиционирует для большого объёма озвучки, голосовых агентов и других задач, где важны скорость и стоимость. Для более сложной художественной работы компания рекомендует Flash TTS, рассчитанную на высокую детализацию исполнения, диалоги и региональные особенности речи.
Попробовать Gemini 3.8 Flash TTS можно прямо в Google AI Studio по странице генерации речи. На фоне заявлений о доступности и высоком качестве запуск выглядит как заметный шаг для тех, кто работает с синтезом голоса в своих проектах.
Насколько сильно Gemini 3.8 Flash TTS изменит рынок нейросетевой озвучки, если она уже доступна в AI Studio?
-
В России возникли проблемы с доступом к Gemini — ограничения связывают с Google -
Gemini 3.5 Transcribe обошла ElevenLabs Scribe v2 по точности и задержке — доля ошибок на готовых записях составила 2,6% -
Google представила Gemini 3.7 Flash: цена вдвое ниже, результат в DeepSWE вырос до 65,3% -
Gemini 3.8 Flash стоит в семь раз дешевле Claude Opus 5 — и обходит его в тестах на финансы, право и работу с видео -
Gemini для Windows вышел — запуск по Alt + Space, генерация видео и работа с Gmail
