Phoenix-4

Нейросеть для генерации реалистичных цифровых аватаров с живыми эмоциями и активным слушанием в реальном времени

Фото: tavus.io

Знакомая беда большинства цифровых спикеров — стеклянный взгляд и жутковатая улыбка, застрявшая на лице даже во время печальных новостей. Команда Tavus подошла к проблеме с анатомической дотошностью: модель Phoenix-4 просчитывает поведение человека в живом диалоге целиком, от легкого приподнимания брови до кивка в паузе собеседника. Система не крутит заготовленные зацикленные видеоролики и не ограничивается подгонкой губ под звук — каждый пиксель головы, плеч и взгляда генерируется на лету с миллисекундной задержкой.

Что умеет

  • Управлять десятком эмоций. Система переключается между радостью, грустью, гневом, удивлением, отвращением, страхом, возбуждением, любопытством и спокойствием. Направлять эмоциональный тон можно промптами через LLM или отдать реакции на откуп контексту диалога.
  • Слушать собеседника. Аватар не замирает в тишине: он вовремя кивает в знак согласия, хмурится от недоумения или проявляет искренний интерес, создавая эффект невербального контакта.
  • Держать картинку в высоком разрешении. Модель выдает стабильные 1080p при частоте 40 кадров в секунду, благодаря чему аватар органично встраивается в любой привычный видеозвонок.
  • Генерировать микромимику без швов. Переходы между речью и молчанием происходят без рывков и дерганий — диффузионный механизм просчитывает движения век, лба, щек и направление взгляда как единый процесс, сохраняя узнаваемость исходного лица.
  • Работать в тандеме с сенсорикой. В связке с моделью восприятия Raven-1 аватар считывает интонацию и жесты пользователя, мгновенно подстраивая ответную мимику под тон разговора.

Инструмент снимает главную головную боль интерактивного продакшена — эффект зловещей долины в живом общении. Для разработчиков интерактивных инсталляций, виртуальных ассистентов и персонажей клиентского сервиса это редкий шанс получить правдоподобного цифрового собеседника, за реакциями которого наконец-то интересно наблюдать.

Сайт Phoenix-4
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд