На каждый деньбесплатноNVIDIA

NVIDIA Nemotron 3 Super

Открытая MoE-модель на 120 млрд параметров с окном в 1 млн токенов для автономных ИИ-агентов

Фото: NVIDIA

Мультиагентные пайплайны быстро упираются в контекст: пересылка истории диалогов и промежуточных шагов раздувает объём данных в пятнадцать раз, сбивая фокус с первоначальной цели. В Nemotron 3 Super инженеры NVIDIA решили эту задачу гибридной архитектурой и длинной памятью. Система объединяет 120 миллиардов параметров, но во время инференса активны лишь 12 миллиардов — экспертные блоки подключаются точечно.

Что умеет

  • Держать в памяти колоссальные объёмы данных. Окно контекста на 1 миллион токенов позволяет загрузить всю кодовую базу целиком или скормить агенту тысячи страниц финансовой аналитики без фрагментации.
  • Оптимизировать вычисления. Слои Mamba вчетверо снижают затраты памяти и процессора, пока блоки трансформеров отвечают за сложные рассуждения.
  • Генерировать ответ быстрее. Алгоритм Multi-Token Prediction прогнозирует сразу несколько последующих слов, ускоряя инференс в три раза.
  • Безошибочно вызывать внешние функции. Модель ориентируется в библиотеках инструментов, выполняя рутинные действия в разработке софта или телекоме.
  • Работать на архитектуре Blackwell. Режим NVFP4 урезает требования к памяти без потерь в качестве генерации.

Цены и доступ

Веса выложены под свободной лицензией. NVIDIA опубликовала подробную методологию: рецепты файнтюнинга, 15 сред подкрепляемого обучения и датасеты объёмом свыше 10 триллионов токенов. Опробовать модель можно через веб-сервисы вроде build.nvidia.com, Hugging Face, OpenRouter и Perplexity либо развернуть локально и в облаках как микросервис NVIDIA NIM.

Разработчикам агентных цепочек инструмент снимает дилемму между ценой запроса и глубиной контекста. Нас подкупила открытость: редкий случай, когда вендор выкладывает не просто веса, а весь тренировочный пайплайн.

Сайт NVIDIA Nemotron 3 Super

Ещё на каждый день

Вся категория →
На каждый день

Gemini 4 Argon

Флагманская модель Google DeepMind для сложного кода, многошаговых процессов и кибербезопасности

На каждый деньплатно

GPT-6.1 Sol

Модель с контекстом в миллион токенов и производительностью уровня Astra по сниженной цене

На каждый деньплатно

Claude Opus 5.5

Флагманская модель для кода, автономных агентов и анализа данных — быстрее и на 40% дешевле Opus 5