NVIDIA тихо собирает полноценный стек для автономных ИИ-агентов, связывая проприетарные API с локальными мощностями. Компания открыла исходный код Switchyard — написанного на Rust прокси-сервера для маршрутизации LLM-трафика, а также представила быструю модель Nemotron 3.5 Lightning, заточенную под непрерывную работу.
Суть Switchyard заключается в бесшовной трансляции протоколов. Инструмент на лету конвертирует запросы между форматами OpenAI Chat и Anthropic Messages. Это позволяет подключить условный Claude Code или Codex к открытым моделям через vLLM или Ollama. Агент продолжает общаться через привычный API, но под капотом работает гибкая маршрутизация. Разработчики могут настроить LLM-классификатор, который будет отправлять базовые запросы на локальные нейросети, а сложные задачи эскалировать в платные облачные API.
Для обработки локального трафика в такой связке NVIDIA предлагает Nemotron 3.5 Lightning. Это модель на 30 млрд параметров, из которых при генерации активируются только 3 млрд. Подобная архитектура дает четырехкратный прирост скорости — критически важный показатель для агентов, постоянно выполняющих фоновые задачи. На тестах PinchBench модель показала точность 86%, закрыв 10 000 задач на 35% быстрее сопоставимой Qwen3.6 35B.
Оба релиза бьют в главную проблему современных AI-инструментов разработки — стоимость и задержки при бесконечных обращениях к облаку. Разработчики получают инструменты для сборки гибридных систем, где рутинный парсинг и написание базового кода происходят локально, а дорогие токены тратятся только там, где реально нужен сильный резонинг.
Поделиться:
Первая задокументированная атака автономных ИИ-агентов на государственную инфраструктуру Тайваня
Релиз Grok 4.6 от xAI: сильные автономные агенты, уровень GPT-5.6 Sol и фокус на визуальных проектах