РазноеElevenLabs

Eleven v4

Новая модель озвучки ElevenLabs, которая слышит паузы и эмоции сценария, а не просто читает текст

Фото: elevenlabs.io

Ведущий телевикторины держит паузу перед последним вопросом, а соперница отвечает шёпотом, с сомнением в голосе — и в демо-ролике не было ни одного актёра озвучки, только модель Eleven v4 от ElevenLabs. Компания называет её самой выразительной моделью синтеза речи из своих разработок: она читает сценарий так, как это делал бы живой актёр — понимает, кто говорит, что только что произошло в сцене, и как должна прозвучать реплика. Рядом вышла версия v4 Turbo — для голосовых агентов и звонков в реальном времени, где важна не столько актёрская игра, сколько скорость ответа.

Что умеет

  • Озвучивает текст на 90+ языках с широким эмоциональным диапазоном, добавляет звуковые эффекты и голоса нескольких говорящих в одной сцене
  • Понимает режиссёрские пометки прямо в тексте — [смеётся], [шепчет], [хлопок двери] — и следует им точнее прежней версии v3
  • Держит темп и интонацию неизменными на длинном тексте: аудиокнига звучит как записанная за один дубль, без швов между главами
  • Не «плывёт» по голосу при повторной генерации одной и той же реплики — хоть раз, хоть пятьдесят
  • Поддерживает клонированные профессиональные голоса с полным эмоциональным диапазоном модели на любом из языков
  • В версии Turbo держит среднюю задержку до первого звука речи около 150 мс — заметно для собеседника в разговоре с агентом
  • Даёт доступ к библиотеке из 17 500+ голосов — от дикторских до игровых и рекламных

Модель доступна в приложениях ElevenLabs, через API и в голосовых агентах компании. Для роликов с закадровым текстом, аудиокниг, подкастов и озвучки прототипов — то есть везде, где раньше звали диктора на студию, — v4 даёт черновик, который уже можно показать клиенту, а Turbo пригодится тем, кто строит голосовых ассистентов и не может ждать секунду тишины после реплики.

Сайт Eleven v4
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд