Состоялся релиз открытых весов модели Qwen3.8-2.4T-A95B, которая сразу получила поддержку в движке вывода vLLM. Это гибридная MoE-нейросеть на 2.4 триллиона параметров, из которых при каждом запросе активируются 95 миллиардов. Архитектура состоит из 92 слоев, где механизм полного внимания применяется только на каждом четвертом слое, а остальные используют линейное внимание, что определяет специфику распределения вычислительной нагрузки. Оригинальные веса в формате BF16 занимают около пяти терабайт дискового пространства.
Для снижения требований к оборудованию сторонние разработчики подготовили квантованные версии модели в форматах NVFP4 и MXFP4. Использование четырехбитного квантования позволяет развернуть нейросеть на одной серверной ноде с ускорителями архитектуры NVIDIA B300 или AMD MI355X, тогда как запуск базовой версии требует минимум двух таких узлов. Разработчики оборудования совместно с авторами фреймворка интегрировали оптимизированные ядра для обработки плотных матриц и маршрутизации экспертов, минимизируя задержки при передаче данных между GPU.
Практическое применение модели демонстрирует стабильные результаты в задачах сложного логического вывода и анализа визуальных данных. Поскольку архитектура изначально спроектирована с упором на длительные рассуждения, для корректной работы агентов на базе Qwen 3.8 требуется выделять увеличенный бюджет токенов, устанавливая высокие значения параметра max_tokens в конфигурации инференса.
Поделиться:
Паттерны работы с AI-агентами на примере официального руководства по Claude Code
NVIDIA разворачивает гибридную инфраструктуру для ИИ-агентов: прокси Switchyard и модель Nemotron 3.5 Lightning