РазноебесплатноHume AI

TADA

Open-source модель озвучки с синхронизацией звука и текста один к одному без задержек и галлюцинаций

Фото: hume.ai

Обычно синтез речи на базе языковых моделей напоминает попытку удержать равновесие на льду: аудиопоток генерирует в разы больше токенов, чем текст, память тает, а диктор внезапно проглатывает фразы или начинает нести отсебятину. Команда Hume AI решила эту проблему архитектурно. В открытой модели TADA каждый текстовый токен намертво привязан к одному непрерывному акустическому вектору. Система идет шаг в шаг с текстом, поэтому физически не способна пропускать реплики или выдумывать лишние слова.

Что умеет

  • Генерировать речь на лету: показатель RTF составляет 0,09 — это более чем в пять раз быстрее аналогичных решений на LLM. Модель обрабатывает всего 2–3 акустических фрейма в секунду.
  • Держать контекст до 10 минут: в стандартное окно на 2048 токенов TADA упаковывает около 700 секунд непрерывной озвучки против привычных 70 секунд у классических систем.
  • Работать без облака: архитектура достаточно легкая, чтобы запускаться локально на смартфонах и компактных устройствах без обращения к внешним серверам.
  • Озвучивать эмоции: в тестах EARS модель показала сходство с оригинальным голосом на уровне 4,18 из 5, а естественность интонаций — 3,78 балла.
  • Исключать артефакты: в выборке из более чем тысячи тестов LibriTTSR зафиксирован нулевой процент галлюцинаций и пропусков текста.

Цены и доступ

Исходный код и веса моделей опубликованы под open-source лицензией. Доступны две версии на базе Llama: модель на 1 миллиард параметров для английского языка и мультиязычный вариант на 3 миллиарда параметров, поддерживающий еще семь языков. Опробовать работу генератора можно в веб-демо на Hugging Face.

Инструмент пригодится разработчикам голосовых интерфейсов, инди-студиям и авторам интерактивных проектов, которым важна автономность без оплаты сторонних API. Пока архитектура ориентирована на продолжение речи и требует дообучения под диалоговых ассистентов, но на выходе получается быстрый голос, который говорит строго по утвержденному сценарию.

Сайт TADA
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд