Wan-S2V
Генерация кинематографичного видео с поющим или говорящим героем из одной картинки и звуковой дорожки

Одиночный портрет и аудиодорожка превращаются в живую сцену: человек на экране начинает петь, откусывать яблоко или эмоционально спорить с невидимым собеседником, пока вокруг хлещет ливень или качается палуба. Wan-S2V — модель генерации видео по статичному кадру и звуку, рассчитанная на кино- и телепроизводство. Система связывает движения губ, мимику лица, пластику тела и операторские приемы вроде наездов камеры или плавного кругового облета.
Что умеет
- Синхронизировать речь и пение. Персонаж произносит монологи, ведет диалог или поет с четкой артикуляцией и естественными сменами эмоций.
- Анимировать разные планы. Модель генерирует фигуры как по пояс, так и в полный рост с сохранением пропорций тела.
- Управлять поведением через текстовые инструкции. Персонаж может отбивать ритм рукой, широко распахивать руки навстречу дождю или жестикулировать во время разговора.
- Задавать окружение и погодные эффекты. В кадр встраиваются штормовые волны, проносящийся пейзаж за окном поезда или мерцающий свет лампы.
- Имитировать кинокамеру. Движок отрабатывает круговой облет дивана, легкое дрожание объектива на ветру или плавное приближение к лицу.
- Держать узнаваемость героя. Разработчики заложили упор на сохранение черт лица и естественность мимики при сложных драматических отыгрышах.
Модель обучали на миллионах примеров речи, пения и танцев, собранных через фильтрацию баз OpenHumanVid и Koala36M. Мы бы попробовали Wan-S2V на раскадровках: вместо набора статичных эскизов арт-директор сразу получает говорящих персонажей в кадре. Для производства клипов и черновых аниматиков это простой способ быстрее добраться от идеи до первого смонтированного дубля.
