Inworld Realtime TTS
Синтез речи с задержкой от 25 мс, клонированием за 15 секунд и поддержкой двухсот языков

Пять секунд исходной аудиозаписи — и виртуальный диктор уже говорит на чистом испанском или японском, сохраняя исходный тембр без постороннего акцента. Inworld выпустил Realtime TTS-2 — движок озвучки реального времени, рассчитанный на разговорных агентов, аудиокниги, озвучку подкастов и интерактивные медиа. Инструмент ориентирован на продакшен и команды разработки, которым критически важна живая реакция без буферизации.
Что умеет
- Клонирование по аудио: захватывает образец голоса из дорожки длиной от 5 до 15 секунд и генерирует дубликат за секунды.
- Создание голоса по описанию: синтезирует готовый тембр из текстового запроса с указанием возраста, акцента и характера подачи без реальных записей.
- Локализация на 200+ языков: обеспечивает нативную речь на английском, французском, хинди, корейском и других языках без потери узнаваемости спикера.
- Стриминг без задержек: отклик до первого байта составляет менее 100 мс на базовой модели TTS-2 и 25 мс на версии Flash через WebSocket.
- Режиссура интонаций в тексте: управление тоном, скоростью, паузами и громкостью через текстовые указания в скобках прямо посреди реплики, а также воспроизведение пяти видов невербальных звуков.
- Выгрузка и форматы: вывод аудиопотока через API в форматах WAV с частотой 48 кГц или OGG Opus на 16 кГц.
Цены и доступ
Попробовать синтез можно в веб-интерфейсе Playground или через API. На масштабе стоимость снижается до $5 за миллион символов (около полуцента за минуту аудио). Для команд доступен тариф Growth, а крупные внедрения тарифицируются отдельно.
Нас подкупила возможность на ходу режиссировать эмоции скобками прямо в теле реплики. Для интерактивных сценариев и сложных закадровых дорожек это избавляет от утомительной нарезки дублей.
