Raven-1
Мультимодальная система, считывающая тон, мимику и паузы собеседника в реальном времени
.png)
Обычные голосовые боты глухи к полутонам: они транскрибируют аудио в голый текст, выбрасывая сарказм, вздохи и заминки. Tavus создала Raven-1 — систему мультимодального восприятия, которая одновременно разбирает видеоряд, интонации и тайминги речи человека. Модель переводит невербальные сигналы не в жесткие категории вроде «радости» или «грусти», а в связные текстовые описания, с которыми языковые модели могут работать напрямую.
Что умеет
- Синхронизация звука и картинки. Модель связывает тембр, высоту голоса, паузы, позу, направление взгляда и мимику лица в единый поток восприятия прямо в процессе разговора.
- Пофразовый трекинг динамики. Raven-1 отслеживает развитие эмоций внутри одной реплики. Система замечает, когда начальный скепсис уступает место любопытству или когда короткие ответы выдают нарастающее раздражение.
- Описания на естественном языке. Вместо сухих числовых баллов модель генерирует понятные формулировки — например, фиксирует притворную бодрость с нотой иронии или потерю интереса из-за взгляда мимо экрана.
- Сверхбыстрый отклик. Аудиоканал формирует описание быстрее чем за 100 миллисекунд, срез визуального контекста обновляется не дольше 300 миллисекунд, а задержка всего пайплайна укладывается в 600 миллисекунд.
- Вызов инструментов по событиям. Архитектура поддерживает привычные схемы API от OpenAI. Разработчик может назначить автоматический вызов функций на смех пользователя, отвлечение внимания или пересечение заданного эмоционального порога.
- Работа в связке. Внутри инфраструктуры Tavus система передает данные о контексте логике диалога Sparrow-1 и генератору мимики Phoenix-4 для подстройки поведения виртуального собеседника.
Создателям интерактивных персонажей и диалоговых сценариев Raven-1 дает шанс избавить ИИ-аватаров от эмоциональной глухоты, научив их вовремя делать паузу и не путать саркастичное согласие с искренним.


