Разноеесть бесплатный тарифInception

Mercury 2.5

Диффузионная языковая модель со скоростью свыше тысячи токенов в секунду для голосовых и поисковых сервисов

Фото: inceptionlabs.ai

Обычные языковые модели заставляют ждать ответа секундами — в живом голосовом диалоге или разветвленном поиске такая пауза ломает весь пользовательский опыт. Команда Inception сделала ставку на диффузионную архитектуру для текста: Mercury 2.5 выдает больше 1100 токенов в секунду на распространенном железе NVIDIA. По уровню логики архитектура выросла на 40% по сравнению с предыдущей версией и теперь сопоставима с оптимизированными компактными моделями вроде Gemini 3.5 Flash-Lite или Claude Haiku 4.5.

Что умеет

  • Держит скорость генерации на уровне 1107 токенов в секунду и контекстное окно на 260 000 токенов.
  • Поддерживает настраиваемое пошаговое рассуждение, параллельный вызов инструментов и выдачу строгого JSON по заданной схеме.
  • Снижает медианную задержку ответа в голосовых агентах до 170 миллисекунд, избавляя собеседника от зависаний.
  • Ускоряет промежуточные шаги поисковых и RAG-пайплайнов, где на один пользовательский запрос приходятся десятки фоновых вызовов модели.
  • Берет на себя упаковку контекста и поиск по инструментам в ассистентах для кода, сокращая время компактизации сессий на 82%.
  • Генерирует работоспособные веб-приложения по нескольким коротким промптам.

Цены и доступ

Штатная стоимость составляет $0,20 за миллион входных токенов и $0,75 за миллион выходных. На запуске действует скидка 80%: $0,04 и $0,15 соответственно. Для проверки API доступно 100 миллионов бесплатных токенов. Опробовать модель можно в чате Inception, через API компании, а также на платформах Baseten и OpenRouter. Для крупных внедрений предусмотрены выделенные мощности и автоскейлинг.

Инструмент пригодится разработчикам голосовых интерфейсов, интерактивных агентов и кодинг-систем — везде, где несколько миллисекунд определяют качество продукта. Нас подкупило, что скорость здесь не принесена в жертву контексту: мгновенная реакция превращает общение с машиной в связный диалог без неловких пауз.

Сайт Mercury 2.5
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд