Разноеесть бесплатный тарифFish Audio

Fish Audio

Генерация речи с точным управлением эмоциями, клонированием за 15 секунд и каталогом из двух миллионов голосов

Фото: fish.audio

Вместо механической начитки диктор заставляет персонажа сбиваться на шепот, вздыхать или нервно посмеиваться прямо посреди фразы. Fish Audio делает ставку на детальную эмоциональную режиссуру синтетической речи: генерация управляется текстовыми тегами настроения и пауз, оживляя закадровый голос для рекламы, анимации и эксплейнеров.

Что умеет

  • Клонирование голоса по короткому образцу длиной от 10–15 секунд с сохранением индивидуальной манеры речи.
  • Точечная расстановка эмоциональных тегов внутри реплик: шепот, злость, грусть, возбуждение или мягкая подача.
  • Добавление живых реакций и пауз: покашливание, смех, вздохи, плач и реакция толпы прямо в теле скрипта.
  • Библиотека из более чем 2 000 000 готовых пользовательских голосов под разные амплуа.
  • Поддержка свыше 30 языков, включая английский, французский, немецкий, арабский, испанский, японский, корейский и китайский.
  • Набор сопутствующих инструментов: перевод аудио, преобразование речи в текст, смена голоса, разделение аудиодорожек и шумовые эффекты.
  • Доступ через веб-редактор и потоковый API с низкой задержкой для создания интерактивных сценариев.

Цены и доступ

Сервис предлагает бесплатный старт с лимитом генераций в месяц — он предназначен только для личных экспериментов. Для коммерческого использования, публикации в рекламе и монетизации предусмотрены платные тарифы. Разработчикам доступен API с тарификацией по факту использования.

Моушн-дизайнерам и видеомейкерам инструмент здорово экономит нервы на этапе сборки: черновую озвучку с нужными актерскими акцентами и точными паузами теперь можно набросать за пару минут прямо перед показом клиенту.

Сайт Fish Audio
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд