TADA
Open-source модель озвучки с синхронизацией звука и текста один к одному без задержек и галлюцинаций

Обычно синтез речи на базе языковых моделей напоминает попытку удержать равновесие на льду: аудиопоток генерирует в разы больше токенов, чем текст, память тает, а диктор внезапно проглатывает фразы или начинает нести отсебятину. Команда Hume AI решила эту проблему архитектурно. В открытой модели TADA каждый текстовый токен намертво привязан к одному непрерывному акустическому вектору. Система идет шаг в шаг с текстом, поэтому физически не способна пропускать реплики или выдумывать лишние слова.
Что умеет
- Генерировать речь на лету: показатель RTF составляет 0,09 — это более чем в пять раз быстрее аналогичных решений на LLM. Модель обрабатывает всего 2–3 акустических фрейма в секунду.
- Держать контекст до 10 минут: в стандартное окно на 2048 токенов TADA упаковывает около 700 секунд непрерывной озвучки против привычных 70 секунд у классических систем.
- Работать без облака: архитектура достаточно легкая, чтобы запускаться локально на смартфонах и компактных устройствах без обращения к внешним серверам.
- Озвучивать эмоции: в тестах EARS модель показала сходство с оригинальным голосом на уровне 4,18 из 5, а естественность интонаций — 3,78 балла.
- Исключать артефакты: в выборке из более чем тысячи тестов LibriTTSR зафиксирован нулевой процент галлюцинаций и пропусков текста.
Цены и доступ
Исходный код и веса моделей опубликованы под open-source лицензией. Доступны две версии на базе Llama: модель на 1 миллиард параметров для английского языка и мультиязычный вариант на 3 миллиарда параметров, поддерживающий еще семь языков. Опробовать работу генератора можно в веб-демо на Hugging Face.
Инструмент пригодится разработчикам голосовых интерфейсов, инди-студиям и авторам интерактивных проектов, которым важна автономность без оплаты сторонних API. Пока архитектура ориентирована на продолжение речи и требует дообучения под диалоговых ассистентов, но на выходе получается быстрый голос, который говорит строго по утвержденному сценарию.


