Meta представила свою первую модель для расшифровки речи в реальном времени
Meta* представила Muse Voice Transcribe — свою первую модель для работы с аудио в реальном времени. По словам компании, система умеет распознавать диктовку и расшифровывать речь более чем 20 спикеров, а также одновременно работать с несколькими языками, а опробовать её можно в новой версии Meta AI для Mac.
модель рассчитана не только на обычную расшифровку речи, но и на более сложные сценарии, где в одном аудиопотоке участвуют несколько человек или используются разные языки. Это может быть полезно для расшифровки встреч, интервью, подкастов и других разговоров, происходящих практически без задержки. Разработчики также уточняют, что Mac-приложение может поддерживать голосовые функции в других приложениях. Кроме того, Muse Voice Transcribe доступна разработчикам через Muse Code и Meta Model API, а в исследовательском блоге Meta есть демоверсия Muse Transcribe.
Meta позиционирует модель как инструмент, который способен работать непосредственно во время разговора, а не только обрабатывать уже записанный аудиофайл. При этом система должна учитывать контекст произносимых слов и самостоятельно выбирать подходящий момент для выдачи результата, что позволяет найти баланс между скоростью и точностью распознавания. Отдельно Meta назвала цену модели — 3 доллара за 1000 аудиоминут.
Модель сама решает, когда слушать. На сложных словах она немного выжидает, а на простых быстрее фиксирует ответ, используя адаптивную задержку, чтобы предсказать каждый токен и повысить точность.
Именно адаптивная задержка является одной из особенностей Muse Voice Transcribe: модель не пытается обрабатывать каждое слово с одинаковой скоростью, а динамически меняет время ожидания в зависимости от сложности распознаваемой речи.
А вы бы стали пользоваться такой системой для расшифровки разговоров, встреч или интервью в реальном времени, если она действительно будет работать без заметных задержек?
*Meta признана экстремисткой организацией в РФ
-
OpenAI запускает расширенного голосового помощника ChatGPT. В сети уже показали, как он имитирует пьяную речь -
Появилось приложение, которое переводит речь в реальном времени и сохраняет голос собеседника -
Meta* начала уведомлять родителей, если подростки говорят с Meta AI о суициде и самоповреждении -
Вживленный в мозг чип вернул речь парализованному пациенту -
В коде Meta AI нашли скрытую функцию NameTag — умные очки смогут распознавать лица