Новость

ElevenLabs выпустила модели v4 с человеческими эмоциями и звуковыми тегами

Фото: ElevenLabs

Таймлайн моушн-ролика почти собран, вы вставляете в сценарий тег с шепотом, жмете кнопку рендера — и вместо синтетического скрежета диктор действительно переходит на приглушенный полувздох. ElevenLabs выкатила новое поколение генераторов речи Eleven v4 и его скоростную версию Eleven v4 Turbo. В основе релиза лежит переписанная с нуля архитектура, нацеленная не просто на чтение букв, а на отработку актерских задач: передачу пауз, эмоциональных перепадов и сценического контекста без привычного металлического холодка.

Главная беда генеративной озвучки в продакшене всегда упиралась в нестабильность: стоило перегенерировать одну реплику ради тайминга анимации, как голос внезапно менял тембр или начинал звенеть. В Eleven v4 проблему так называемого вокального дрейфа убрали. Система контекстного сшива (Context Stitching) удерживает подачу и характер диктора неизменными даже при многократных перезаписях одной строки. Это же новшество позволяет собирать километровые аудиокниги и длинные закадровые эксплейнеры с монолитным темпом от первого до последнего предложения. Лимит на один запрос составляет 10 000 символов, чего с головой хватает для полноценной сцены или рекламного блока.

В модель вшили распознавание текстовых ремарок прямо в теле скрипта. Теперь генератор корректно отыгрывает скобки вроде [laughs], [whispers] или даже интершумы вроде [door slams], не пытаясь прочесть служебные слова вслух. По сравнению с третьей версией распознавание таких триггеров стало в разы чище. Сетка поддерживает более 90 языков, причем разработчики сделали акцент на аутентичном произношении и артикуляции — среди примеров фигурируют японский, испанский и португальский.

Аудио: ElevenLabs

В четвертую версию вернули профессиональное клонирование (Professional Voice Clones), выпавшее из v3. Теперь цифровая копия студийного голоса сохраняет весь спектр экспрессии и умеет говорить на любом из девяноста доступных языков без карикатурного акцента. В связке с этим работают привычные креативные утилиты:

  • Мгновенное клонирование (Instant Voice Clones) — собирает рабочий дубликат по 10-секундному фрагменту исходника;
  • Дизайн голоса (Voice Design) — генерирует оригинальный тембр по словесному описанию внешности или характера персонажа;
  • Словарь произношения (Pronunciation Dictionary) — позволяет вручную зашивать фонемы для брендовых названий, трудных фамилий и специфических терминов.

Для интерактивных инсталляций, голосовых ассистентов и живых диалоговых систем выпустили облегченную Eleven v4 Turbo. Модель заточена под моментальную реакцию: за счет двунаправленного стриминга синтез стартует до того, как языковая модель допишет фразу до точки. Медианная задержка инференса держится в районе 100 миллисекунд, а метрика ожидания первой фразы опережает основные альтернативы на рынке.

МодельМедианное время до первой речи (TTFS)
Eleven v4 Turbo150 мс
Cartesia Sonic 3.6262 мс
OpenAI GPT-4o mini TTS814 мс
Аудио: ElevenLabs

В каталоге платформы собрано свыше 17 500 готовых голосов. Их рассортировали по категориям: нарратив, диалоги, форматы для соцсетей, игровые персонажи, обучающие материалы, реклама, развлекательный контент и мультиязычные пресеты. Готовый материал можно забирать в сжатом MP3 для подкастов и веба, в телефонийном стандарте µ-law или в чистом студийном WAV / PCM без потерь, пригодном для сведения с саунд-дизайном прямо в монтажной программе.

Интегрировать модели в пайплайны предлагают через REST API, потоковые веб-сокеты и официальные SDK для TypeScript и Python. Тарифную сетку разделили на три уровня:

  • Бесплатный пакет (Free): $0 в месяц, 10 000 кредитов для личных тестов, привязка банковской карты не требуется;
  • Премиальный уровень (Premium): от $6 ежемесячно, от 30 000 кредитов, открывает профессиональное клонирование, приоритетную очередь генерации и расширенные лимиты;
  • Корпоративный план (Enterprise): персональные контракты с индивидуальным биллингом, поддержкой кастомного SSO и максимальной пропускной способностью.

Звуковой лид Accenture Accelerate Кайл Гудмундсон отозвался о работе с флагманом без лишней корпоративной дипломатии: «Когда я впервые запустил ее, звук был настолько чистым и живым, будто я работал с живым диктором в студийной будке». Нас в этой истории подкупает другое: черновая начитка в видеопродакшене окончательно перестает звучать как голосовой помощник из навигатора. Режиссеру анимации больше не нужно выпрашивать у диктора переозвучку трехсекундного вздоха ради утверждения монтажного тайминга у привередливого клиента.

Аудио: ElevenLabs

Синтетический голос научился чувствовать драматургию текста раньше, чем дизайнеры привыкли доверять его качеству.

Ещё новости

Все новости →