Это самая изящная реализация переноса движений за последнее время. Команда Alibaba выкатила открытую модель Wan-Animate-2, и старый подход с жестким pose-control официально устарел. Архитектура напрямую передает управляющее видео в переработанный Diffusion Transformer. Промежуточные костыли в виде экстракторов скелетов больше не нужны. Нейросеть сама считывает мимику, физику одежды и сложную моторику рук.
Главный технический сдвиг — полная отвязка ракурса генерации от исходного ролика. Вы можете взять референс, снятый строго в анфас, и через текстовый запрос заставить виртуальную камеру облететь персонажа сбоку или сверху. Само движение при этом не ломается! По логике работы это прямой конкурент SCAIL-2, но акценты расставлены иначе. Если SCAIL-2 лучше справляется с многофигурными сценами, то Wan-Animate-2 выигрывает именно в чистом копировании пластики и свободе операторской работы.
Разработчики сразу опубликовали скрипты инференса и веса базовой модели на 14B параметров. Для тех, кому важна скорость, есть дистиллированная версия Wan-Animate-2-Lite. Она требует всего 10 шагов генерации, что вплотную приближает процесс к реалтайму и открывает дорогу для стриминга интерактивных персонажей. Инструмент уже получил нативную поддержку в библиотеке diffusers, поэтому локальный запуск требует минимума усилий.
Поделиться:
Критическая угроза или маркетинг: почему OpenAI приостанавливает работу над моделью Astra
Anthropic делает Auto Mode режимом по умолчанию в Claude Code: почему ИИ проверяет команды лучше людей