РазноеInworld AI

Realtime TTS-2

Речевая модель для живого диалога с режиссурой интонаций через текстовые промпты

Фото: inworld.ai

Разговор с голосовым ассистентом обычно напоминает чтение аудиокниги по ролям: диктор звучит ровно, но глух к собеседнику. Realtime TTS-2 от Inworld AI меняет этот подход в корне. Модель ориентируется на реальное входящее аудио диалога — интонации, паузы и энергетику человека — и мгновенно подстраивает собственную подачу под услышанное.

Что умеет

  • Режиссура голоса промптами. Характер подачи задается обычным текстом в квадратных скобках прямо перед репликой. Вместо зашитых пресетов система слушается развернутых указаний вроде описания степени усталости или скрытой тревоги.
  • Контекст живого разговора. Движок получает звук предыдущих реплик сессии целиком, а не плоскую текстовую расшифровку. Та же самая фраза прозвучит мягче после плохих новостей или заметно бодрее после удачной шутки.
  • Один тембр на сотню языков. Модель держит единую личность спикера при переключении между более чем 100 языками, сохраняя характер персонажа даже в пределах одного предложения.
  • Генерация голоса по брифу. Функция Advanced Voice Design собирает новый голос по текстовому описанию возраста, тембра и манеры речи без кастинга актеров и референсных треков.
  • Человеческая органика. В реплику можно встраивать маркеры смеха, вздохов или дыхания. Алгоритм естественно расставляет запинки и междометия, свойственные реальному размышлению вслух.
  • Быстрое клонирование. Собственный голос переносится в систему по короткому чистому фрагменту записи от 5 до 15 секунд.
  • Три настройки стабильности. Можно выбрать профиль: Expressive для максимальной раскованности персонажей, сбалансированный Balanced или строгий Stable без дрейфа высоты тона.

Доступ

Модель находится в общем доступе через Inworld API и Realtime API с готовыми SDK для Node и Python, а также поддерживает клиентский протокол OpenAI Realtime. Опробовать работу цепочки в браузере через микрофон можно на realtime.ai.

Решение пригодится разработчикам игр, интерактивным дизайнерам и авторам аудиовизуальных сервисов, где безликий робот рушит погружение. Мы бы взяли такой синтез в интерактивные сцены с живыми диалогами, где пауза и полуулыбка в голосе значат больше самих слов.

Сайт Realtime TTS-2
Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд

Разное

Eleven v4

Новая модель озвучки ElevenLabs, которая слышит паузы и эмоции сценария, а не просто читает текст