Eleven v4 предпочли конкурирующим моделям 75% слушателей в слепых тестах — она поддерживает более 90 языков
ElevenLabs представила новое поколение моделей синтеза речи — Eleven v4 и Eleven v4 Turbo. Новинки получили обновленную архитектуру, которая должна лучше учитывать не только сам текст, но и контекст, интонацию, темп, эмоции и особенности подачи. Параллельно модели появились в сравнительных тестах Artificial Analysis, где качество речи оценивалось в том числе в слепых прослушиваниях.
Обе модели поддерживают более 90 языков, включая русский, английский, китайский, японский, корейский и ряд менее распространенных языков. Eleven v4 рассчитана прежде всего на создание готового контента — озвучку видео, аудиокниг, персонажей и других длинных материалов. Eleven v4 Turbo предназначена для приложений, где важна минимальная задержка, например голосовых ассистентов и AI-агентов.
Одним из ключевых направлений обновления стало сохранение индивидуальности голоса. Eleven v4 лучше удерживает тембр, манеру речи и особенности исходного диктора, причем стабильность должна сохраняться даже при повторной генерации отдельных фрагментов и работе с длинными сценариями. Для многоспикерных сцен также предусмотрена поддержка нескольких голосов. Instant Voice Clones позволяют создать копию голоса всего по 10 секундам аудиозаписи, а Professional Voice Clones предназначены для случаев, когда требуется более точное и стабильное воспроизведение исходного голоса.
Для управления подачей Eleven v4 поддерживает текстовые теги. С их помощью можно указать эмоцию, манеру произнесения или действие непосредственно в сценарии — например, [laughs], [whispers], [sighs], а также различные звуковые события. По данным ElevenLabs, медианная задержка вывода составляет около 100 миллисекунд, а время до появления первого звука — примерно 150 миллисекунд. Модель поддерживает потоковую передачу, поэтому речь может начинать воспроизводиться еще до того, как система полностью сформирует ответ.
Обе модели доступны через ElevenAPI, а также используются в продуктах ElevenLabs для создания контента и голосовых AI-агентов. При этом компания продолжает развивать модели после запуска, поэтому их характеристики и поведение могут меняться по мере дальнейшего обучения и обновлений.
Как вы думаете, что важнее для синтеза речи: поддержка множества языков или точное сохранение индивидуальности голоса?
-
Sandbar представила кольцо-диктофон, которое умеет клонировать голос владельца -
Представлены наушники Lenovo с функцией перевода и голосовым клонированием -
Gemini 3.8 Flash TTS генерирует речь на 100+ языках с 2000 голосами и поддержкой диалогов -
Опенсорсный сервис на базе Qwen превратит книги в аудиокниги с клонированием голоса

