NVIDIA выпустила открытую модель Nemotron 3.5 Lightning для постоянно работающих автономных ИИ-агентов. В основе лежит гибридная архитектура Mixture-of-Experts, объединяющая слои Mamba-2, MoE и Attention. Из общих 30 млрд параметров при генерации активируются только 3 млрд. Это повышает скорость работы до четырех раз по сравнению с моделями аналогичного размера. Контекст составляет до 1 млн токенов. Модель запускается на одной видеокарте H100 или RTX 5090.
Для быстрого вывода используются форматы NVFP4 и W4A16, а также алгоритмы спекулятивного декодирования. На тестах агентских систем модель обходит конкурентов по скорости. В бенчмарке PinchBench она набирает более 83% точности. Массив из 10 000 задач выполняется на 35% быстрее Qwen3.6 35B. В тестах программирования SWE-bench Verified результат достигает 52.80.
Модель распространяется по открытой лицензии OpenMDW 1.1. Доступны веса, тренировочные данные и рецепты для развертывания через vLLM. Систему можно дообучать на собственных датасетах и интегрировать в RAG-пайплайны. Низкое потребление ресурсов позволяет разворачивать локальных агентов на пользовательском железе без потери скорости.
Поделиться:
Пайплайн 3D-моушн-дизайнера: симуляции в Houdini, концертный маппинг и коммерческая графика
Архитектура и деплой Qwen 3.8 Max: 2.4 триллиона параметров в открытом доступе