Raven-1

Мультимодальная система, считывающая тон, мимику и паузы собеседника в реальном времени

Фото: tavus.io

Обычные голосовые боты глухи к полутонам: они транскрибируют аудио в голый текст, выбрасывая сарказм, вздохи и заминки. Tavus создала Raven-1 — систему мультимодального восприятия, которая одновременно разбирает видеоряд, интонации и тайминги речи человека. Модель переводит невербальные сигналы не в жесткие категории вроде «радости» или «грусти», а в связные текстовые описания, с которыми языковые модели могут работать напрямую.

Что умеет

  • Синхронизация звука и картинки. Модель связывает тембр, высоту голоса, паузы, позу, направление взгляда и мимику лица в единый поток восприятия прямо в процессе разговора.
  • Пофразовый трекинг динамики. Raven-1 отслеживает развитие эмоций внутри одной реплики. Система замечает, когда начальный скепсис уступает место любопытству или когда короткие ответы выдают нарастающее раздражение.
  • Описания на естественном языке. Вместо сухих числовых баллов модель генерирует понятные формулировки — например, фиксирует притворную бодрость с нотой иронии или потерю интереса из-за взгляда мимо экрана.
  • Сверхбыстрый отклик. Аудиоканал формирует описание быстрее чем за 100 миллисекунд, срез визуального контекста обновляется не дольше 300 миллисекунд, а задержка всего пайплайна укладывается в 600 миллисекунд.
  • Вызов инструментов по событиям. Архитектура поддерживает привычные схемы API от OpenAI. Разработчик может назначить автоматический вызов функций на смех пользователя, отвлечение внимания или пересечение заданного эмоционального порога.
  • Работа в связке. Внутри инфраструктуры Tavus система передает данные о контексте логике диалога Sparrow-1 и генератору мимики Phoenix-4 для подстройки поведения виртуального собеседника.

Создателям интерактивных персонажей и диалоговых сценариев Raven-1 дает шанс избавить ИИ-аватаров от эмоциональной глухоты, научив их вовремя делать паузу и не путать саркастичное согласие с искренним.

Сайт Raven-1
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд