NVIDIA Nemotron 3 Super
Открытая MoE-модель на 120 млрд параметров с окном в 1 млн токенов для автономных ИИ-агентов

Мультиагентные пайплайны быстро упираются в контекст: пересылка истории диалогов и промежуточных шагов раздувает объём данных в пятнадцать раз, сбивая фокус с первоначальной цели. В Nemotron 3 Super инженеры NVIDIA решили эту задачу гибридной архитектурой и длинной памятью. Система объединяет 120 миллиардов параметров, но во время инференса активны лишь 12 миллиардов — экспертные блоки подключаются точечно.
Что умеет
- Держать в памяти колоссальные объёмы данных. Окно контекста на 1 миллион токенов позволяет загрузить всю кодовую базу целиком или скормить агенту тысячи страниц финансовой аналитики без фрагментации.
- Оптимизировать вычисления. Слои Mamba вчетверо снижают затраты памяти и процессора, пока блоки трансформеров отвечают за сложные рассуждения.
- Генерировать ответ быстрее. Алгоритм Multi-Token Prediction прогнозирует сразу несколько последующих слов, ускоряя инференс в три раза.
- Безошибочно вызывать внешние функции. Модель ориентируется в библиотеках инструментов, выполняя рутинные действия в разработке софта или телекоме.
- Работать на архитектуре Blackwell. Режим NVFP4 урезает требования к памяти без потерь в качестве генерации.
Цены и доступ
Веса выложены под свободной лицензией. NVIDIA опубликовала подробную методологию: рецепты файнтюнинга, 15 сред подкрепляемого обучения и датасеты объёмом свыше 10 триллионов токенов. Опробовать модель можно через веб-сервисы вроде build.nvidia.com, Hugging Face, OpenRouter и Perplexity либо развернуть локально и в облаках как микросервис NVIDIA NIM.
Разработчикам агентных цепочек инструмент снимает дилемму между ценой запроса и глубиной контекста. Нас подкупила открытость: редкий случай, когда вендор выкладывает не просто веса, а весь тренировочный пайплайн.

