Phoenix-4
Нейросеть для генерации реалистичных цифровых аватаров с живыми эмоциями и активным слушанием в реальном времени

Знакомая беда большинства цифровых спикеров — стеклянный взгляд и жутковатая улыбка, застрявшая на лице даже во время печальных новостей. Команда Tavus подошла к проблеме с анатомической дотошностью: модель Phoenix-4 просчитывает поведение человека в живом диалоге целиком, от легкого приподнимания брови до кивка в паузе собеседника. Система не крутит заготовленные зацикленные видеоролики и не ограничивается подгонкой губ под звук — каждый пиксель головы, плеч и взгляда генерируется на лету с миллисекундной задержкой.
Что умеет
- Управлять десятком эмоций. Система переключается между радостью, грустью, гневом, удивлением, отвращением, страхом, возбуждением, любопытством и спокойствием. Направлять эмоциональный тон можно промптами через LLM или отдать реакции на откуп контексту диалога.
- Слушать собеседника. Аватар не замирает в тишине: он вовремя кивает в знак согласия, хмурится от недоумения или проявляет искренний интерес, создавая эффект невербального контакта.
- Держать картинку в высоком разрешении. Модель выдает стабильные 1080p при частоте 40 кадров в секунду, благодаря чему аватар органично встраивается в любой привычный видеозвонок.
- Генерировать микромимику без швов. Переходы между речью и молчанием происходят без рывков и дерганий — диффузионный механизм просчитывает движения век, лба, щек и направление взгляда как единый процесс, сохраняя узнаваемость исходного лица.
- Работать в тандеме с сенсорикой. В связке с моделью восприятия Raven-1 аватар считывает интонацию и жесты пользователя, мгновенно подстраивая ответную мимику под тон разговора.
Инструмент снимает главную головную боль интерактивного продакшена — эффект зловещей долины в живом общении. Для разработчиков интерактивных инсталляций, виртуальных ассистентов и персонажей клиентского сервиса это редкий шанс получить правдоподобного цифрового собеседника, за реакциями которого наконец-то интересно наблюдать.


