NVIDIA выпустила открытую модель Nemotron 3.5 Lightning, заточенную под непрерывную работу ИИ-агентов. Это гибридная архитектура Mixture-of-Experts (MoE) на 30 млрд параметров, из которых при каждом запросе активируются только 3 млрд. Такой подход дает скорость генерации до четырех раз выше, чем у монолитных моделей сопоставимого размера. Сейчас к ней открыт бесплатный доступ через API OpenRouter с огромным окном контекста в 1 млн токенов и лимитом вывода до 65 тысяч токенов.
Для автономных систем это один из лучших вариантов по соотношению скорости и качества на данный момент! На тестах PinchBench модель показала точность 86% и обработала 10 000 задач на 35% быстрее, чем Qwen3.6 35B, не уступив в качестве ответов. При пропускной способности в 41 токен в секунду и задержке ответа около 1.2 секунды, Nemotron отлично справляется с высоконагруженными сценариями, где важна моментальная реакция.
Модель достаточно компактна для локального запуска, а открытые веса позволяют дообучать ее под специфические корпоративные задачи и процессы. Для быстрого теста через OpenRouter достаточно передать nvidia/nemotron-3.5-lightning:free в параметре model, используя стандартные OpenAI-совместимые библиотеки.
Поделиться:
Релиз Grok 4.6 от xAI: сильные автономные агенты, уровень GPT-5.6 Sol и фокус на визуальных проектах
Разбор изображений на RGBA-слои: что скрывается под капотом Stable-Layers от Stability AI