Новость

ElevenLabs выпустила модель Eleven v4 с контекстным чтением сценариев

The image presents a vibrant abstract design with a gradient of orange and red hues. The design is composed of diagonal lines that create a sense of movement and energy. The text "Eleven V4" is prominently displayed in the center of the image, written in a white sans-serif font. The background is a blend of orange, red
Фото: ElevenLabs

Пятидесятый дубль генерации одной и той же реплики для рекламного ролика обычно превращается в пытку: цифровой голос начинает срываться, теряет тембр или уходит в механический скрежет. В ElevenLabs подошли к проблеме прицельно. Новая архитектура Eleven v4 удерживает характер персонажа даже после пятидесяти перегенераций подряд — диктор звучит ровно в том же регистре, в каком начал, без внезапных акустических мутаций.

Главный сдвиг случился в понимании драматургии. Модель перестала воспринимать текст как механический набор предложений и теперь разбирает сценарий по принципу живого актера: оценивает сюжетную линию, настроение сцены и реплики партнеров по диалогу. Для режиссуры внутри текста предусмотрели прямые теги: если прописать в скрипте [laughs], [whispers] или [door slams], генератор отреагирует на них естественными паузами, смешками или приглушением голоса. Нас подкупило, что в релиз наконец вернули Professional Voice Clone — профессиональное клонирование отсутствовало в третьей версии, из-за чего собирать сложные кастомные голоса для продакшена приходилось окольными путями.

The image presents a vibrant abstract design with a gradient of orange and green colors. The design is composed of diagonal lines that create a sense of movement and energy. The text "Eleven V4" is prominently displayed in the center of the image, written in a bold, sans-serif font.
Фото: ElevenLabs

Режиссура длинного метра и стриминг

Для озвучки длинных форм развернули технологию context stitching. Она сшивает фрагменты полотна без слышимых стыков: при переходе от абзаца к абзацу темп повествования и эмоциональный накал не сбрасываются в исходную точку. Каталог доступных языков расширили с семидесяти до более чем девяноста. Впрочем, независимые тесты пока проводились преимущественно на английском языке — как поведут себя остальные девяносто, предстоит проверять на практике самостоятельно.

Параллельно вышла облегченная модификация v4 Turbo, заточенная под интерактивные сценарии и работу в реальном времени. Ее параметры:

The image presents a vibrant digital art piece featuring a gradient background transitioning from a warm orange at the top to a lighter shade towards the bottom. The text "Eleven V4" is prominently displayed in white, positioned in the top left corner. The word "Turbo" is written in white in the bottom right corner. Th
Фото: ElevenLabs
  • Задержка до первого звука составляет около 150 миллисекунд;
  • Двунаправленный стриминг позволяет отдавать голос в эфир еще до того, как языковая модель допишет фразу до конца;
  • Скорость выдачи выросла до 73,4 символа в секунду против 42,5 символа у предыдущего поколения архитектуры.

Бенчмарки и сравнение с конкурентами

В тестах независимой платформы Artificial Analysis модель уверенно вышла вперед, забрав верхнюю строчку общего рейтинга Provider Voice Arena. Особенно заметен отрыв в тесте на точность произношения сложных конструкций и имен собственных, где v4 показала рекордные 91,7%.

МодельРейтинг Arena (Elo)Точность произношенияСкорость генерацииСтоимость за 1M знаков
Eleven v4131991,7%73,4 симв/сек$80
Cartesia Sonic 3.61276——$49
Gemini 3.8 Flash TTS126789,5%—$16.49
Eleven v3—85,6%42,5 симв/секдороже v4

В общем зачете арены новинка обошла Cartesia Sonic 3.6 и Gemini 3.8 Flash TTS во всех четырех целевых дисциплинах: развлечения, клиентская поддержка, ассистенты и обучающие платформы. Небольшая заминка возникла лишь в тесте Controlled Voice, где модели сопоставляли на базе одного и того же эталонного голоса: там Eleven v4 с результатом 1157 пунктов уступила лидерство модели Qwen-Audio-3.1-TTS-Plus от Alibaba, оставшись на втором месте.

Экономика и применение в продакшене

Ценовая планка установлена на уровне 80 долларов за миллион символов. Это заметно доступнее тарифов третьей версии, но все еще существенно дороже рынка. Прямой соперник Gemini 3.8 Flash TTS стоит почти в пять раз меньше — $16.49 за миллион знаков, Cartesia Sonic 3.6 обходится в $49, а альтернативы от Inworld, Grok и Soniox стоят еще дешевле.

Для массовых колл-центров с миллионными бюджетами минут подобный ценник может стать барьером — там юнит-экономика быстро уйдет в минус. Но в премиальном визуальном продакшене, записи аудиокниг, создании брендовых голосов, рекламе и кинодубляже переплата оправдана: возможность управлять эмоциональными паузами через разметку и чистая артикуляция без артефактов экономят часы работы саунд-дизайнера на монтаже.

Синтетический дубляж наконец перестал звучать как чтение по словарю и начал попадать в тайминги живой актерской игры.

Ещё новости

Все новости →