Команда исследователей из Alibaba представила Wan-Animate-2 — фреймворк для анимации персонажей на основе статического изображения и референсного видео. Архитектура модели отказывается от использования промежуточных репрезентаций вроде экстракции скелетов или масок, напрямую обрабатывая исходные данные через модифицированный Diffusion Transformer. Подобный подход позволяет избежать типичных ошибок распознавания позы и сохранить мелкую моторику, включая мимику лица и движения пальцев, в результате чего повышается общая точность переноса движений.
Специфической чертой системы является возможность текстового управления ракурсом, что позволяет отвязать перспективу финальной генерации от угла съемки референсного видео без разрушения физики движения. Модель также поддерживает одновременную работу с несколькими персонажами в кадре, выступая прямой альтернативой архитектуре SCAIL-2, при этом решение от Alibaba в большей степени сфокусировано на изоляции трансфера движений и контроле виртуальной камеры.
Для задач, требующих минимальной задержки, была разработана оптимизированная версия Wan-Animate-2-Lite, которая за счет трехэтапной системы обучения и дистилляции способна генерировать анимацию в реальном времени из потока веб-камеры. Это снижение вычислительной нагрузки делает технологию применимой для стриминга и интеграции в интерактивные цифровые аватары, а для стимулирования дальнейших исследований разработчики планируют выпустить базовые веса модели в открытый доступ.
Поделиться:
Критическая угроза или маркетинг: почему OpenAI приостанавливает работу над моделью Astra
Alibaba выпустила Wan-Animate-2: end-to-end генерация анимации без скелетов и с текстовым управлением камерой