ElevenLabs выпустила модель Eleven v4 с контекстным чтением сценариев

Пятидесятый дубль генерации одной и той же реплики для рекламного ролика обычно превращается в пытку: цифровой голос начинает срываться, теряет тембр или уходит в механический скрежет. В ElevenLabs подошли к проблеме прицельно. Новая архитектура Eleven v4 удерживает характер персонажа даже после пятидесяти перегенераций подряд — диктор звучит ровно в том же регистре, в каком начал, без внезапных акустических мутаций.
Главный сдвиг случился в понимании драматургии. Модель перестала воспринимать текст как механический набор предложений и теперь разбирает сценарий по принципу живого актера: оценивает сюжетную линию, настроение сцены и реплики партнеров по диалогу. Для режиссуры внутри текста предусмотрели прямые теги: если прописать в скрипте [laughs], [whispers] или [door slams], генератор отреагирует на них естественными паузами, смешками или приглушением голоса. Нас подкупило, что в релиз наконец вернули Professional Voice Clone — профессиональное клонирование отсутствовало в третьей версии, из-за чего собирать сложные кастомные голоса для продакшена приходилось окольными путями.

Режиссура длинного метра и стриминг
Для озвучки длинных форм развернули технологию context stitching. Она сшивает фрагменты полотна без слышимых стыков: при переходе от абзаца к абзацу темп повествования и эмоциональный накал не сбрасываются в исходную точку. Каталог доступных языков расширили с семидесяти до более чем девяноста. Впрочем, независимые тесты пока проводились преимущественно на английском языке — как поведут себя остальные девяносто, предстоит проверять на практике самостоятельно.
Параллельно вышла облегченная модификация v4 Turbo, заточенная под интерактивные сценарии и работу в реальном времени. Ее параметры:

- Задержка до первого звука составляет около 150 миллисекунд;
- Двунаправленный стриминг позволяет отдавать голос в эфир еще до того, как языковая модель допишет фразу до конца;
- Скорость выдачи выросла до 73,4 символа в секунду против 42,5 символа у предыдущего поколения архитектуры.
Бенчмарки и сравнение с конкурентами
В тестах независимой платформы Artificial Analysis модель уверенно вышла вперед, забрав верхнюю строчку общего рейтинга Provider Voice Arena. Особенно заметен отрыв в тесте на точность произношения сложных конструкций и имен собственных, где v4 показала рекордные 91,7%.
| Модель | Рейтинг Arena (Elo) | Точность произношения | Скорость генерации | Стоимость за 1M знаков |
|---|---|---|---|---|
| Eleven v4 | 1319 | 91,7% | 73,4 симв/сек | $80 |
| Cartesia Sonic 3.6 | 1276 | — | — | $49 |
| Gemini 3.8 Flash TTS | 1267 | 89,5% | — | $16.49 |
| Eleven v3 | — | 85,6% | 42,5 симв/сек | дороже v4 |
В общем зачете арены новинка обошла Cartesia Sonic 3.6 и Gemini 3.8 Flash TTS во всех четырех целевых дисциплинах: развлечения, клиентская поддержка, ассистенты и обучающие платформы. Небольшая заминка возникла лишь в тесте Controlled Voice, где модели сопоставляли на базе одного и того же эталонного голоса: там Eleven v4 с результатом 1157 пунктов уступила лидерство модели Qwen-Audio-3.1-TTS-Plus от Alibaba, оставшись на втором месте.
Экономика и применение в продакшене
Ценовая планка установлена на уровне 80 долларов за миллион символов. Это заметно доступнее тарифов третьей версии, но все еще существенно дороже рынка. Прямой соперник Gemini 3.8 Flash TTS стоит почти в пять раз меньше — $16.49 за миллион знаков, Cartesia Sonic 3.6 обходится в $49, а альтернативы от Inworld, Grok и Soniox стоят еще дешевле.
Для массовых колл-центров с миллионными бюджетами минут подобный ценник может стать барьером — там юнит-экономика быстро уйдет в минус. Но в премиальном визуальном продакшене, записи аудиокниг, создании брендовых голосов, рекламе и кинодубляже переплата оправдана: возможность управлять эмоциональными паузами через разметку и чистая артикуляция без артефактов экономят часы работы саунд-дизайнера на монтаже.
Синтетический дубляж наконец перестал звучать как чтение по словарю и начал попадать в тайминги живой актерской игры.


