Mercury 2
Диффузионная языковая модель для голосовых ассистентов с генерацией от 1000 токенов в секунду

Когда голосовой ассистент берет паузу в три секунды перед ответом, трубку хочется повесить. Mercury 2 от Inception Labs снимает эту заминку с помощью диффузионного механизма: вместо пошаговой генерации токенов система восстанавливает текст из шума параллельно по всей длине строки. Скорость на стандартных платах NVIDIA H100 превышает 1000 токенов в секунду. Цепочка рассуждений из 300 токенов завершается за 300 миллисекунд, поэтому модель успевает взвесить вызовы инструментов и правила диалога прямо внутри телефонной реплики, укладываясь в комфортный слуховой интервал.
Что умеет
- Генерировать текст диффузией. Архитектура dLLM снимает структурное ограничение авторегрессионных сетей и загружает вычислительные мощности видеокарт на полную силу.
- Настраивать время на размышления. Регулятор
reasoning_effortпредлагает четыре режима: от моментальногоinstantдля простых междометий доlow,mediumиhighдля ветвистых сценариев и сервисных функций. - Держать планку компактных моделей. Качество рассуждений и следования инструкциям сопоставимо с GPT Mini и Claude Haiku, а в специализированных тестах вроде IFBench модель обходит GPT 4.1.
- Подключаться к стандартным стекам. Интерфейс совместим с API OpenAI и легко встает в каскадные цепочки через оркестраторы LiveKit, Pipecat, Vapi или Retell.
Цены и доступ
API открыт на платформе разработчиков. Стоимость составляет $0,25 за миллион входных токенов и $0,75 за миллион выходных, что в типовом голосовом диалоге дает около половины цента за минуту работы модели.
Инструмент ориентирован на инженеров и продакшены голосовых интерфейсов, которым нужны логика и дисциплина моделей-рассуждателей без задержек, убивающих живую беседу.


