Mercury 2.5
Диффузионная языковая модель со скоростью свыше тысячи токенов в секунду для голосовых и поисковых сервисов

Обычные языковые модели заставляют ждать ответа секундами — в живом голосовом диалоге или разветвленном поиске такая пауза ломает весь пользовательский опыт. Команда Inception сделала ставку на диффузионную архитектуру для текста: Mercury 2.5 выдает больше 1100 токенов в секунду на распространенном железе NVIDIA. По уровню логики архитектура выросла на 40% по сравнению с предыдущей версией и теперь сопоставима с оптимизированными компактными моделями вроде Gemini 3.5 Flash-Lite или Claude Haiku 4.5.
Что умеет
- Держит скорость генерации на уровне 1107 токенов в секунду и контекстное окно на 260 000 токенов.
- Поддерживает настраиваемое пошаговое рассуждение, параллельный вызов инструментов и выдачу строгого JSON по заданной схеме.
- Снижает медианную задержку ответа в голосовых агентах до 170 миллисекунд, избавляя собеседника от зависаний.
- Ускоряет промежуточные шаги поисковых и RAG-пайплайнов, где на один пользовательский запрос приходятся десятки фоновых вызовов модели.
- Берет на себя упаковку контекста и поиск по инструментам в ассистентах для кода, сокращая время компактизации сессий на 82%.
- Генерирует работоспособные веб-приложения по нескольким коротким промптам.
Цены и доступ
Штатная стоимость составляет $0,20 за миллион входных токенов и $0,75 за миллион выходных. На запуске действует скидка 80%: $0,04 и $0,15 соответственно. Для проверки API доступно 100 миллионов бесплатных токенов. Опробовать модель можно в чате Inception, через API компании, а также на платформах Baseten и OpenRouter. Для крупных внедрений предусмотрены выделенные мощности и автоскейлинг.
Инструмент пригодится разработчикам голосовых интерфейсов, интерактивных агентов и кодинг-систем — везде, где несколько миллисекунд определяют качество продукта. Нас подкупило, что скорость здесь не принесена в жертву контексту: мгновенная реакция превращает общение с машиной в связный диалог без неловких пауз.


