Mercury Voice
Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд

В живом голосовом интерфейсе пауза длиннее полусекунды превращает диалог в неловкое ожидание. Mercury Voice от команды Inception — диффузионная языковая модель (dLLM), спроектированная специально для голосовых ассистентов. Вместо мучительного выбора между сообразительностью и скоростью модель выдаёт первый токен ответа за 320 миллисекунд (медиана) и успевает рассуждать прямо перед репликой.
Что умеет
- Мгновенно отвечать в диалоге. Время генерации первого слышимого токена составляет 320 мс при p50 и 750 мс при p95 на боевых пользовательских запросах.
- Рассуждать на лету. Предусмотрены три режима аналитической нагрузки (low, medium, high), позволяющие настраивать баланс между скоростью реакции и глубиной логики.
- Держать объёмный контекст. Контекстное окно вмещает 128 000 токенов на входе и способно отдавать до 50 000 токенов на выходе.
- Работать с внешними инструментами. Модель поддерживает вызовы функций (tool calling) и удерживает сложные, длинные системные промпты.
- Встраиваться в готовые пайплайны. Поддерживается эндпоинт, совместимый с форматом OpenAI API, благодаря чему модель интегрируется в платформы LiveKit, Pipecat, Vapi и Retell.
Цены и доступ
Модель доступна корпоративным клиентам через Inception API по обращению в отдел продаж. Базовая цена составляет $0,40 за миллион входных токенов и $1,50 за миллион выходных. На этапе запуска действует скидка 50% ($0,20 и $0,75 соответственно), что даёт стоимость около $0,009 за минуту разговора.
Командам, которые собирают интерактивные звуковые стенды, голосовых телефонных ботов или сервис автораздачи, инструмент поможет срезать задержки без потери интеллекта. По-нашему, когда система думает быстрее полусекунды, диалог с машиной наконец перестаёт напоминать сеанс связи по рации.


