Gemini 3.8 Flash TTS генерирует речь на 100+ языках с 2000 голосами и поддержкой диалогов

Gemini 3.8 Flash TTS генерирует речь на 100+ языках с 2000 голосами и поддержкой диалогов

Arkadiy Andrienko

В Google AI Studio уже доступна генерация речи на базе Gemini 3.8 Flash TTS: вместе с флагманской моделью компания выпустила и более доступную версию Flash-Lite TTS. Обе модели рассчитаны на разные сценарии использования: Flash TTS делает ставку на качество, выразительность и гибкую настройку звучания, а Flash-Lite — на высокую скорость и массовую генерацию аудио.

Gemini 3.8 Flash TTS поддерживает 130 языков, а Flash-Lite — 101 язык, включая русский. Кроме того, пользователям доступна библиотека из более чем 2000 готовых голосов с различными языками, акцентами и региональными особенностями. При этом выбирать голос из готового списка необязательно: собственный голос можно создать с нуля с помощью текстового промпта, задав его характер, тембр, акцент и особенности подачи. Отдельно Google расширила возможности управления самой манерой речи. С помощью текстовых инструкций можно задавать темп, эмоциональную окраску, стиль исполнения и особенности произношения. В отдельных фрагментах поддерживаются и звуковые реакции вроде смеха, вздохов, кашля и пауз, благодаря чему синтезированная речь может звучать не как обычная озвучка текста, а как полноценное исполнение.

Модели также умеют работать с диалогами нескольких персонажей. Для каждой реплики можно отдельно задавать параметры исполнения, поэтому технология подходит для подкастов, аудиокниг, дубляжа, игровых персонажей и других проектов, где требуется взаимодействие нескольких голосов. Google отдельно отмечает улучшенную стабильность тембра и звучания при длинных многоходовых диалогах.

Теперь появиться широкий спектр по возможностям озвучки
Теперь появиться широкий спектр по возможностям озвучки

Ещё одна функция — репликация голоса. Google заявляет, что для создания копии достаточно 30-секундного образца, однако использовать можно только голос с разрешением его владельца: система предусматривает проверку согласия. Сгенерированное аудио также получает невидимую водяную метку SynthID, предназначенную для определения материалов, созданных ИИ.

При этом Flash-Lite ориентирована прежде всего на массовую и более дешёвую генерацию: её Google позиционирует для большого объёма озвучки, голосовых агентов и других задач, где важны скорость и стоимость. Для более сложной художественной работы компания рекомендует Flash TTS, рассчитанную на высокую детализацию исполнения, диалоги и региональные особенности речи.

Попробовать Gemini 3.8 Flash TTS можно прямо в Google AI Studio по странице генерации речи. На фоне заявлений о доступности и высоком качестве запуск выглядит как заметный шаг для тех, кто работает с синтезом голоса в своих проектах.

Насколько сильно Gemini 3.8 Flash TTS изменит рынок нейросетевой озвучки, если она уже доступна в AI Studio?

🥚 В CS2 добавили питомцев — куриц и петухов
    Об авторе
    Комментарии0