Fish Audio
Генерация речи с точным управлением эмоциями, клонированием за 15 секунд и каталогом из двух миллионов голосов

Вместо механической начитки диктор заставляет персонажа сбиваться на шепот, вздыхать или нервно посмеиваться прямо посреди фразы. Fish Audio делает ставку на детальную эмоциональную режиссуру синтетической речи: генерация управляется текстовыми тегами настроения и пауз, оживляя закадровый голос для рекламы, анимации и эксплейнеров.
Что умеет
- Клонирование голоса по короткому образцу длиной от 10–15 секунд с сохранением индивидуальной манеры речи.
- Точечная расстановка эмоциональных тегов внутри реплик: шепот, злость, грусть, возбуждение или мягкая подача.
- Добавление живых реакций и пауз: покашливание, смех, вздохи, плач и реакция толпы прямо в теле скрипта.
- Библиотека из более чем 2 000 000 готовых пользовательских голосов под разные амплуа.
- Поддержка свыше 30 языков, включая английский, французский, немецкий, арабский, испанский, японский, корейский и китайский.
- Набор сопутствующих инструментов: перевод аудио, преобразование речи в текст, смена голоса, разделение аудиодорожек и шумовые эффекты.
- Доступ через веб-редактор и потоковый API с низкой задержкой для создания интерактивных сценариев.
Цены и доступ
Сервис предлагает бесплатный старт с лимитом генераций в месяц — он предназначен только для личных экспериментов. Для коммерческого использования, публикации в рекламе и монетизации предусмотрены платные тарифы. Разработчикам доступен API с тарификацией по факту использования.
Моушн-дизайнерам и видеомейкерам инструмент здорово экономит нервы на этапе сборки: черновую озвучку с нужными актерскими акцентами и точными паузами теперь можно набросать за пару минут прямо перед показом клиенту.


