NVIDIA открыла код ARDY: потоковая генерация 3D-анимаций с гибридным трансформером

NVIDIA тихо выкатила в опенсорс ARDY — авторегрессионную диффузионную модель, которая решает главную проблему генерации 3D-анимаций. До сих пор разработчикам приходилось выбирать между точным контролем в тяжелых офлайн-моделях вроде Kimodo и скоростью онлайн-методов, которые часто теряли контекст. Новая архитектура генерирует движения гуманоидов в реальном времени, позволяя менять текстовые промпты и точки маршрута прямо на лету, причем компания сразу опубликовала исходный код, веса и рабочее демо.
Под капотом работает гибридное представление данных и двухэтапный трансформер. Движение корневой кости просчитывается явно для точного позиционирования в координатах сцены, а кинематика остального тела сжимается в компактный латентный эмбеддинг. Модель сначала авторегрессионно предсказывает глобальную траекторию, а затем достраивает движения конечностей. За счет этого можно бесшовно перестраивать анимацию: достаточно кликнуть мышкой в новую точку или переписать промпт с шага на прыжки, и система мгновенно адаптирует генерацию без предварительного рендера.
Пайплайн изначально проектировался с прицелом на физическую робототехнику и сложные игровые симуляции. В связке с политикой трекинга SONIC систему уже применяют для прямого управления роботом Unitree G1. Модель способна выдавать бесконечный стриминг движений, удерживая контекст длинных сцен и строго соблюдая пространственные ограничения, что переводит процедурную анимацию в статус готового инструмента для интерактивных сред.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад