MiMo-V2-Flash
Быстрая открытая языковая модель на 309 миллиардов параметров для рассуждений и работы агентов
Xiaomi выкатила открытую языковую модель MiMo-V2-Flash с архитектурой смеси экспертов (MoE). При общем объёме в 309 миллиардов параметров на каждый запрос активируются всего 15 миллиардов. Архитектура изначально сфокусирована на высокой скорости генерации и решении агентных задач с длинным контекстом, не требуя колоссальных затрат на вычисления.
Что умеет
- Удерживать контекст до 256k токенов. Гибридный механизм внимания чередует локальные скользящие окна по 128 токенов и глобальные слои в пропорции 5:1, снижая объём KV-кэша почти в шесть раз.
- Ускорять выдачу в три раза. Встроенный блок Multi-Token Prediction (MTP) прогнозирует несколько токенов одновременно прямо во время генерации.
- Решать агентные задачи. Модель прошла обучение с подкреплением на более чем 100 000 задач из реальных репозиториев GitHub, а исполнение кода для веб-разработки проверялось специальным мультимодальным верификатором по видеозаписям.
- Сохранять цепочку рассуждений. В режиме размышлений инструмент отдаёт поле с ходом мыслей параллельно вызовам функций, что позволяет связывать сложные многоэтапные цепочки действий.
Цены и доступ
Веса базовой и дообученной версий MiMo-V2-Flash, включая трёхслойный модуль MTP, выложены бесплатно на платформе Hugging Face. Для локального или серверного запуска разработчики рекомендуют использовать движок SGLang с поддержкой смешанной точности FP8.
Инструмент пригодится инженерам и техническим креаторам, собирающим собственных автономных агентов для вёрстки, кодинга и обработки огромных объёмов проектной документации на собственном железе.

