Eleven v4
Новая модель озвучки ElevenLabs, которая слышит паузы и эмоции сценария, а не просто читает текст

Ведущий телевикторины держит паузу перед последним вопросом, а соперница отвечает шёпотом, с сомнением в голосе — и в демо-ролике не было ни одного актёра озвучки, только модель Eleven v4 от ElevenLabs. Компания называет её самой выразительной моделью синтеза речи из своих разработок: она читает сценарий так, как это делал бы живой актёр — понимает, кто говорит, что только что произошло в сцене, и как должна прозвучать реплика. Рядом вышла версия v4 Turbo — для голосовых агентов и звонков в реальном времени, где важна не столько актёрская игра, сколько скорость ответа.
Что умеет
- Озвучивает текст на 90+ языках с широким эмоциональным диапазоном, добавляет звуковые эффекты и голоса нескольких говорящих в одной сцене
- Понимает режиссёрские пометки прямо в тексте — [смеётся], [шепчет], [хлопок двери] — и следует им точнее прежней версии v3
- Держит темп и интонацию неизменными на длинном тексте: аудиокнига звучит как записанная за один дубль, без швов между главами
- Не «плывёт» по голосу при повторной генерации одной и той же реплики — хоть раз, хоть пятьдесят
- Поддерживает клонированные профессиональные голоса с полным эмоциональным диапазоном модели на любом из языков
- В версии Turbo держит среднюю задержку до первого звука речи около 150 мс — заметно для собеседника в разговоре с агентом
- Даёт доступ к библиотеке из 17 500+ голосов — от дикторских до игровых и рекламных
Модель доступна в приложениях ElevenLabs, через API и в голосовых агентах компании. Для роликов с закадровым текстом, аудиокниг, подкастов и озвучки прототипов — то есть везде, где раньше звали диктора на студию, — v4 даёт черновик, который уже можно показать клиенту, а Turbo пригодится тем, кто строит голосовых ассистентов и не может ждать секунду тишины после реплики.


