Опенсорсный сервис на базе Qwen превратит книги в аудиокниги с клонированием голоса
WhiskeyCoder выложил на GitHub Qwen3 Audiobook Converter — опенсорсный инструмент для тех, кто хочет быстро собрать аудиокнигу из текста. В проекте есть и клонирование голоса, и поддержка нескольких форматов, а сам проект уже доступен на GitHub.
Сервис умеет конвертировать в аудиокниги файлы PDF, EPUB, DOCX, DOC и TXT. Для этого перед запуском нужен локально запущенный Qwen Voice Model с Gradio-интерфейсом, а на машине должны быть установлены Python 3.8+ и FFmpeg. В Qwen3 Audiobook Converter есть режим с несколькими голосами, который пригодится для художественной литературы.
В основе проекта лежит Qwen3 TTS объёмом 1,7 млрд параметров. Авторы называют его вариантом с самым высоким качеством, а в настройках по умолчанию указан голос Ryan — профессиональный мужской диктор на английском языке.
По данным проекта, модель обрабатывает один фрагмент текста примерно за 4–5 минут. Готовые аудиокниги сохраняются в формате MP3. Если захотите оценить результат сами, в репозитории есть и пример аудио, и ссылка на модель Qwen3 TTS. К слову, весной вышла Вышла Qwen 3.6 без цензуры — нейросеть, которая не скажет «это противоречит моим принципам».
Озвучка книг с клонированием голоса и многоголосием — это удобный инструмент или уже слишком спорный подход?
-
Ваш фикус теперь может поболтать с вами голосом ChatGPT: OpenAI выложила необычный проект Plant Talk -
В сеть выложили ИИ, который копирует русский голос по 5 секундам записи -
Google научилась создавать видео с вашим лицом и голосом — теперь камера может стать ненужной -
В Xbox Insider появилась возможность записывать голосовой чат в геймплейных клипах -
NVIDIA представила Nemotron VoiceChat — открытый голосовой ассистент для разработчиков
