Alibaba тихо выкатила веса Qwen 3.8 Max — самой крупной открытой модели на сегодня с 2.4 триллионами параметров. В активном режиме на токен задействуется 95B параметров. Оригинальные веса в bf16 занимают внушительные 5 терабайт, но сообщество уже собрало квантованные версии в NVFP4 и MXFP4. На визуальных VLM-задачах модель уже показывает результаты, превосходящие закрытые коммерческие решения.
В основе архитектуры лежит гибридный подход, масштабированный до 92 слоев. Разработчики скрестили Gated DeltaNet (GDN) и классическое GQA-внимание с Mixture-of-Experts. Из 512 экспертов активны 10 маршрутизируемых и один общий. Использование линейного внимания GDN со встроенным State Space Model дает потребление памяти O(1) на слой, сохраняя вычислительную сложность O(N). Это позволяет балансировать затраты на длинном контексте без потери качества генерации.
Для запуска такого массива требуются серьезные мощности — одна нода на топовых ускорителях вроде B300 или MI355X, либо кластер из карт предыдущих поколений. Команда SGLang оперативно подготовила day-0 рецепты для деплоя. Движок из коробки поддерживает спекулятивное декодирование через встроенную MTP-голову или драфт-модель DSpark, а также дает готовые конфигурации для мультинодовых сборок на чипах NVIDIA и AMD.
Поделиться:
Разбор изображений на RGBA-слои: что скрывается под капотом Stable-Layers от Stability AI
Единый договор вместо сотен: как 4dev.com закрывает риски с IP-правами при работе с глобальными командами