Команда Alibaba выпустила Wan-Animate-2 — end-to-end фреймворк для анимации персонажей на базе обновленной архитектуры Diffusion Transformer. Модель напрямую обрабатывает управляющее видео, полностью исключая из пайплайна промежуточные экстракторы, такие как скелетная анимация или карты контроля поз. В результате нейросеть точнее переносит мелкую моторику, мимику и движения рук, избегая артефактов, свойственных многоступенчатым системам с жесткой привязкой к направляющим.
Дополнительным архитектурным внедрением стало текстовое управление ракурсом, что позволяет отвязать перспективу итоговой генерации от положения камеры в исходном ролике. На фоне концептуально близкого алгоритма SCAIL-2, который адаптирован для сложной замены объектов и многофигурных сцен, Wan-Animate-2 фокусируется на задачах прямого переноса движений с возможностью корректировки угла обзора без разрушения физики объектов.
Перед инференсом пайплайн требует формирования точного описания внешности и фона без упоминания действий, что достигается предварительной обработкой через LLM. Разработчики опубликовали веса базовой модели на 14B параметров и дистиллированную версию, которая сокращает количество шагов и снижает задержку инференса до пороговых значений потоковой генерации. Фреймворк уже интегрирован в библиотеку diffusers, при этом стандартные конфигурации рассчитаны на вывод видео в разрешении 720p.
Поделиться:
xAI выпустила Grok Imagine Image 2.0 с мощным редактором и точным контролем типографики
Критическая угроза или маркетинг: почему OpenAI приостанавливает работу над моделью Astra