РазноеплатноInception

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд

Фото: inceptionlabs.ai

В живом голосовом интерфейсе пауза длиннее полусекунды превращает диалог в неловкое ожидание. Mercury Voice от команды Inception — диффузионная языковая модель (dLLM), спроектированная специально для голосовых ассистентов. Вместо мучительного выбора между сообразительностью и скоростью модель выдаёт первый токен ответа за 320 миллисекунд (медиана) и успевает рассуждать прямо перед репликой.

Что умеет

  • Мгновенно отвечать в диалоге. Время генерации первого слышимого токена составляет 320 мс при p50 и 750 мс при p95 на боевых пользовательских запросах.
  • Рассуждать на лету. Предусмотрены три режима аналитической нагрузки (low, medium, high), позволяющие настраивать баланс между скоростью реакции и глубиной логики.
  • Держать объёмный контекст. Контекстное окно вмещает 128 000 токенов на входе и способно отдавать до 50 000 токенов на выходе.
  • Работать с внешними инструментами. Модель поддерживает вызовы функций (tool calling) и удерживает сложные, длинные системные промпты.
  • Встраиваться в готовые пайплайны. Поддерживается эндпоинт, совместимый с форматом OpenAI API, благодаря чему модель интегрируется в платформы LiveKit, Pipecat, Vapi и Retell.

Цены и доступ

Модель доступна корпоративным клиентам через Inception API по обращению в отдел продаж. Базовая цена составляет $0,40 за миллион входных токенов и $1,50 за миллион выходных. На этапе запуска действует скидка 50% ($0,20 и $0,75 соответственно), что даёт стоимость около $0,009 за минуту разговора.

Командам, которые собирают интерактивные звуковые стенды, голосовых телефонных ботов или сервис автораздачи, инструмент поможет срезать задержки без потери интеллекта. По-нашему, когда система думает быстрее полусекунды, диалог с машиной наконец перестаёт напоминать сеанс связи по рации.

Сайт Mercury Voice
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разное

Eleven v4

Новая модель озвучки ElevenLabs, которая слышит паузы и эмоции сценария, а не просто читает текст