Realtime TTS-2
Речевая модель для живого диалога с режиссурой интонаций через текстовые промпты

Разговор с голосовым ассистентом обычно напоминает чтение аудиокниги по ролям: диктор звучит ровно, но глух к собеседнику. Realtime TTS-2 от Inworld AI меняет этот подход в корне. Модель ориентируется на реальное входящее аудио диалога — интонации, паузы и энергетику человека — и мгновенно подстраивает собственную подачу под услышанное.
Что умеет
- Режиссура голоса промптами. Характер подачи задается обычным текстом в квадратных скобках прямо перед репликой. Вместо зашитых пресетов система слушается развернутых указаний вроде описания степени усталости или скрытой тревоги.
- Контекст живого разговора. Движок получает звук предыдущих реплик сессии целиком, а не плоскую текстовую расшифровку. Та же самая фраза прозвучит мягче после плохих новостей или заметно бодрее после удачной шутки.
- Один тембр на сотню языков. Модель держит единую личность спикера при переключении между более чем 100 языками, сохраняя характер персонажа даже в пределах одного предложения.
- Генерация голоса по брифу. Функция Advanced Voice Design собирает новый голос по текстовому описанию возраста, тембра и манеры речи без кастинга актеров и референсных треков.
- Человеческая органика. В реплику можно встраивать маркеры смеха, вздохов или дыхания. Алгоритм естественно расставляет запинки и междометия, свойственные реальному размышлению вслух.
- Быстрое клонирование. Собственный голос переносится в систему по короткому чистому фрагменту записи от 5 до 15 секунд.
- Три настройки стабильности. Можно выбрать профиль: Expressive для максимальной раскованности персонажей, сбалансированный Balanced или строгий Stable без дрейфа высоты тона.
Доступ
Модель находится в общем доступе через Inworld API и Realtime API с готовыми SDK для Node и Python, а также поддерживает клиентский протокол OpenAI Realtime. Опробовать работу цепочки в браузере через микрофон можно на realtime.ai.
Решение пригодится разработчикам игр, интерактивным дизайнерам и авторам аудиовизуальных сервисов, где безликий робот рушит погружение. Мы бы взяли такой синтез в интерактивные сцены с живыми диалогами, где пауза и полуулыбка в голосе значат больше самих слов.


