ElevenLabs выпустила модели v4 с человеческими эмоциями и звуковыми тегами

Таймлайн моушн-ролика почти собран, вы вставляете в сценарий тег с шепотом, жмете кнопку рендера — и вместо синтетического скрежета диктор действительно переходит на приглушенный полувздох. ElevenLabs выкатила новое поколение генераторов речи Eleven v4 и его скоростную версию Eleven v4 Turbo. В основе релиза лежит переписанная с нуля архитектура, нацеленная не просто на чтение букв, а на отработку актерских задач: передачу пауз, эмоциональных перепадов и сценического контекста без привычного металлического холодка.
Главная беда генеративной озвучки в продакшене всегда упиралась в нестабильность: стоило перегенерировать одну реплику ради тайминга анимации, как голос внезапно менял тембр или начинал звенеть. В Eleven v4 проблему так называемого вокального дрейфа убрали. Система контекстного сшива (Context Stitching) удерживает подачу и характер диктора неизменными даже при многократных перезаписях одной строки. Это же новшество позволяет собирать километровые аудиокниги и длинные закадровые эксплейнеры с монолитным темпом от первого до последнего предложения. Лимит на один запрос составляет 10 000 символов, чего с головой хватает для полноценной сцены или рекламного блока.
В модель вшили распознавание текстовых ремарок прямо в теле скрипта. Теперь генератор корректно отыгрывает скобки вроде [laughs], [whispers] или даже интершумы вроде [door slams], не пытаясь прочесть служебные слова вслух. По сравнению с третьей версией распознавание таких триггеров стало в разы чище. Сетка поддерживает более 90 языков, причем разработчики сделали акцент на аутентичном произношении и артикуляции — среди примеров фигурируют японский, испанский и португальский.
В четвертую версию вернули профессиональное клонирование (Professional Voice Clones), выпавшее из v3. Теперь цифровая копия студийного голоса сохраняет весь спектр экспрессии и умеет говорить на любом из девяноста доступных языков без карикатурного акцента. В связке с этим работают привычные креативные утилиты:
- Мгновенное клонирование (Instant Voice Clones) — собирает рабочий дубликат по 10-секундному фрагменту исходника;
- Дизайн голоса (Voice Design) — генерирует оригинальный тембр по словесному описанию внешности или характера персонажа;
- Словарь произношения (Pronunciation Dictionary) — позволяет вручную зашивать фонемы для брендовых названий, трудных фамилий и специфических терминов.
Для интерактивных инсталляций, голосовых ассистентов и живых диалоговых систем выпустили облегченную Eleven v4 Turbo. Модель заточена под моментальную реакцию: за счет двунаправленного стриминга синтез стартует до того, как языковая модель допишет фразу до точки. Медианная задержка инференса держится в районе 100 миллисекунд, а метрика ожидания первой фразы опережает основные альтернативы на рынке.
| Модель | Медианное время до первой речи (TTFS) |
|---|---|
| Eleven v4 Turbo | 150 мс |
| Cartesia Sonic 3.6 | 262 мс |
| OpenAI GPT-4o mini TTS | 814 мс |
В каталоге платформы собрано свыше 17 500 готовых голосов. Их рассортировали по категориям: нарратив, диалоги, форматы для соцсетей, игровые персонажи, обучающие материалы, реклама, развлекательный контент и мультиязычные пресеты. Готовый материал можно забирать в сжатом MP3 для подкастов и веба, в телефонийном стандарте µ-law или в чистом студийном WAV / PCM без потерь, пригодном для сведения с саунд-дизайном прямо в монтажной программе.
Интегрировать модели в пайплайны предлагают через REST API, потоковые веб-сокеты и официальные SDK для TypeScript и Python. Тарифную сетку разделили на три уровня:
- Бесплатный пакет (Free): $0 в месяц, 10 000 кредитов для личных тестов, привязка банковской карты не требуется;
- Премиальный уровень (Premium): от $6 ежемесячно, от 30 000 кредитов, открывает профессиональное клонирование, приоритетную очередь генерации и расширенные лимиты;
- Корпоративный план (Enterprise): персональные контракты с индивидуальным биллингом, поддержкой кастомного SSO и максимальной пропускной способностью.
Звуковой лид Accenture Accelerate Кайл Гудмундсон отозвался о работе с флагманом без лишней корпоративной дипломатии: «Когда я впервые запустил ее, звук был настолько чистым и живым, будто я работал с живым диктором в студийной будке». Нас в этой истории подкупает другое: черновая начитка в видеопродакшене окончательно перестает звучать как голосовой помощник из навигатора. Режиссеру анимации больше не нужно выпрашивать у диктора переозвучку трехсекундного вздоха ради утверждения монтажного тайминга у привередливого клиента.
Синтетический голос научился чувствовать драматургию текста раньше, чем дизайнеры привыкли доверять его качеству.


