Новость

Tavus показал ИИ-аватаров реального времени с реакцией быстрее трети секунды

Смотреть на Tavus
Видео: Tavus

Вы прерываете собеседника на полуслове, он замолкает, считывает выражение лица через веб-камеру ноутбука и мгновенно перестраивает ответ. Собеседник при этом собран из пикселей прямо в браузере. Компания Tavus выкатила превью Griffin — первой видео-видео модели для живого взаимодействия, способной проходить визуальный тест Тьюринга. В слепых тестах разработчиков 48% участников приняли сгенерированное лицо за реального человека.

Обычно подобные интерфейсы спотыкаются о рассинхрон: аватар либо зависает перед каждой фразой, либо механически тараторит поверх слов пользователя. Tavus подошел к задаче через стек из четырех синхронизированных foundational-моделей под общим брендом PAL (Personal AI Companion). За логику диалога отвечает Sparrow-2. Эта модель занимает первую строчку бенчмарка TurnBench, точно улавливая микропаузы, перебивания, фоновый шум и реплики нескольких людей в комнате.

Смотреть на Tavus
Видео: Tavus

Архитектура живого диалога

Картинку формирует Phoenix-4.5 — генератор мимики, который тратит на рендеринг лица всего 134 миллисекунды, что на 25% быстрее решений конкурентов. Модель берет одиночную фотографию и в режиме zero-shot достраивает движения верхней части тела, жестикуляцию и пластику. За восприятие среды отвечает модель Raven-1. Она параллельно обрабатывает три потока: голос, видео с камеры и контекст происходящего на экране пользователя. Частота обновления контекста составляет менее 300 миллисекунд. Вершиной архитектуры выступает Griffin, который объединяет перцепцию и видеогенерацию в единый сквозной процесс.

Смотреть на Tavus
Видео: Tavus

На базе этой связки платформа разворачивает интерактивных компаньонов с набором прикладных возможностей:

  • Presentation Mode: способность проводить презентации, самостоятельно переключая слайды и комментируя визуальный ряд;
  • Magic Canvas: генерация интерфейса прямо по ходу разговора — от интерактивных графиков и опросников до расписаний;
  • Видеозвонки: интеграция в Google Meet, Zoom и Microsoft Teams в качестве полноценного участника с поддержкой камеры и звука в реальном времени;
  • Browser Use: навигация по сайтам, демонстрация экрана и интерактивный запуск продуктов в браузере;
  • LLM-бэкенд: работа на быстрых встроенных моделях или прямое подключение внешних пользовательских языковых сетей;
  • Knowledge Base: загрузка внутренних документов компании для ответов строго по фактам без галлюцинаций;
  • Память и рассуждения: удержание контекста между прошлыми сессиями для продолжения разговора с брошенного места.

Для внедрения компаньонов платформа подготовила три пути. Инженерным командам открыли Developer API для сборки кастомных видеоинтерфейсов. Креаторам без строчки кода отдали PAL Maker — конструктор, где роль, внешность и базу знаний виртуального репетитора, консьержа или интервьюера настраивают за несколько минут. Для крупных корпоративных заказчиков предусмотрен формат Enterprise Solutions с индивидуальной разработкой под ключ. Решениями Tavus уже пользуются свыше 150 000 разработчиков.

Практика показывает вполне конкретные бизнес-результаты. В Salesforce агент Piper обрабатывает десятки тысяч обращений в день: число назначенных встреч выросло в шесть раз, вовлеченность в диалоги удвоилась, а сам сервис стал лидером категории AI SDR на платформе G2. Сервис Orum внедрил тренажер Aurora для репетиции звонков и отработки возражений сейлз-команд. Результаты: время адаптации новых сотрудников сократилось на 50%, конверсия выросла в три раза, а выручка от коучинга поднялась на 25%.

Смотреть на Tavus
Видео: Tavus

«Визуальный контакт и эмоциональная связь повышают ставки в разговоре, делая практику значительно эффективнее», — объясняет вице-президент по продукту Orum Боб Аспелл (Bob Aspell).

Еще один сценарий показал проект Ruby от Med Learning Group и Regeneron. Это первый медицинский ИИ-консультант по плоскоклеточному раку кожи (cSCC) для непрерывного образования врачей. Ассистент улучшил понимание сложного клинического материала на 65% и получил официальную аккредитацию ACCME и AMA.

Для креаторов и моушн-дизайнеров эта новость знаменует переход в другую лигу. Мы годами строили интерактивные ролики на ветвящихся деревьях из заранее снятых видеофрагментов или мирились с запаздывающим липсинком. Теперь цифровой персонаж перестает быть глухой записью. Он следит за экраном, подстраивается под жесты собеседника, берет органичные паузы и отвечает без задержки. Интерактивный продакшен становится диалогом без монтажных склеек.

Ещё новости

Все новости →