Новость

Shengshu показала генерацию интерактивного видео на лету с линейкой Vidu S

The image presents a sequence of steps in the creation of a Vivid S2-Avatar and Vivid S2-Editing video. The top section depicts the initial stages of the process, starting with a red mug and progressing through a clothing jacket, a beach scene, and a virtual reality headset. The bottom section shows the final stages of
Фото: GitHub

Вы отправляете в видеопоток новую картинку прямо посреди трансляции, говорите пару слов в микрофон, и цифровой персонаж на экране без секундной паузы меняет одежду, продолжая сложный танец. Интерактивная видеогенерация на глазах перестает быть историей про бесконечное ожидание рендера одного кадра. Китайская компания Shengshu-ai выкатила семейство моделей Vidu S, созданных именно для потоковой работы в реальном времени.

В линейку вошли две системы: более ранняя Vidu S1, вышедшая в июле 2026 года, и свежая Vidu S2, представленная в сентябре того же года. Главный упор разработчики сделали на скорость отклика и управляемость прямо во время эфира, избавившись от классического барьера пакетной обработки.

The image shows a man with dark brown or black hair and a light complexion, smiling at the camera. He is wearing a white t-shirt and has a neutral expression. The background is a light beige or tan color. The image is divided into three sections, each featuring a different item of clothing: sunglasses, a baseball cap,
Фото: Vidu

Архитектура Vidu S2 и живой монтаж

Флагманская Vidu S2 значительно поднимает планку качества картинки и вариативности управления. Модель разделена на специализированные функциональные блоки:

  • Vidu S2-Avatar: генерирует видеопоток в разрешении 720p с кадровой частотой от 25 до 42 кадров в секунду. Модуль справляется со сложной хореографией и динамикой движений, позволяя на лету подмешивать новые референсные изображения прямо в процессе текущего стрима.
  • Vidu S2-Editing: отвечает за трансформацию живого входящего сигнала по статичным картинкам-образцам. Сюда зашиты виртуальная примерка одежды (virtual try-on), стилизация, моментальная замена фона или самого героя без потери исходной пластики движений.
  • Пространственный режим: формирует синхронизированные стереопары под гарнитуры виртуальной реальности и иммерсивные экраны.
The image shows a young woman with dark hair pulled back in a ponytail, wearing a light purple or lavender t-shirt. She is smiling warmly at the camera, her eyes meeting the viewer's gaze. The background is a light purple color, with the number "72P" displayed in a light gray or silver color.
Фото: Vidu

Долгая непрерывная генерация обычно страдает от деградации картинки, когда мелкие артефакты накапливаются от кадра к кадру и превращают сцену в кашу. Чтобы решить эту проблему, инженеры Shengshu-ai применили метод обучения Self-Replay Forcing: модель тренировали на ее собственных зашумленных траекториях генерации. Для запуска на сравнительно недорогом потребительском железе разработали связку TurboDiffusion и TurboServe. Она объединяет квантование матричных умножений (low-bit GEMM), эффективные механизмы внимания (efficient attention), кастомные вычислительные ядра и многопроцессорный конвейеринг.

Голосовой контроль в Vidu S1

Июльская модель Vidu S1 проектировалась как решение для быстрого создания диалоговых аватаров. Она работает с разрешением 540p на скорости до 42 кадров в секунду на обычных потребительских видеокартах. Главная фишка первой версии — прямое управление голосом: персонаж слушает устные команды пользователя и мгновенно перестраивает свое поведение в кадре. Система одинаково гладко оживляет живых людей, стилизованных аниме-героев, домашних животных и кастомных маскотов.

The image shows a young woman with long, dark hair and bangs, wearing a black leather jacket, a black baseball cap, and aviator-style sunglasses. She is also wearing large, gold hoop earrings. The background is out of focus, but appears to be a city street with colorful lights. The image is overlaid with a banner that
Фото: Vidu
ПараметрVidu S1Vidu S2
Дата выходаИюль 2026Сентябрь 2026
Рабочее разрешение540p720p
Скорость генерацииДо 42 FPS25–42 FPS
Фокусные задачиГолосовой интерактив, аватары людей и животныхЖивой монтаж, примерка, сложный моушн, стереопары VR
Научная публикацияarXiv:2607.03118arXiv:2609.11638

Интеграция и доступ для разработчиков

Опробовать возможности Vidu S2 авторы предлагают на официальном сайте платформы. Для тех, кто планирует встраивать генератор в свои продакшен-пайплайны, компания подготовила документацию и спецификации API на английском и китайском языках, включая готовые сценарии быстрого старта для S2-Avatar и S2-Editing. Не забыли и про автоматизацию: для ИИ-агентов Claude Code, Codex и OpenClaw доступен специальный навык vidu-s-api.

Для креативных команд и моушн-дизайнеров это открывает понятный прикладной сценарий: интерактивные стримы, цифровые шоурумы с моментальной сменой луков и виртуальные витрины больше не требуют многонедельного пререндера. Нас подкупило то, что Shengshu делает упор на оптимизацию под доступные видеокарты, а не закрывает технологию в недосягаемых кластерах. Стрим становится пластилином прямо в момент эфира.

Ещё новости

Все новости →