Kandinsky 6.0 Video научился генерировать пятисекундные ролики синхронно со звуком

Привычный процесс сборки нейросетевого ролика напоминает немое кино: сначала генерация картинки, затем долгий подбор фоли-шумов и попытка натянуть синтезированный голос на шевелящиеся невпопад губы. Команда KandinskyLab решила убрать этот зазор и выпустила семейство базовых диффузионных моделей Kandinsky 6.0 Video. Главная перемена — видеоряд и звуковая дорожка теперь рождаются в едином цикле, без промежуточных костылей и ручной склейки.
Архитектура рассчитана на два сценария: генерацию из текста (T2AV) и оживление статичного кадра (TI2AV). На выходе получаются пятисекундные клипы с чистым звуком частотой дискретизации 44 кГц. При этом алгоритм сразу решает классическую проблему рассинхронизации: модель поддерживает лип-синк, подстраивая артикуляцию персонажа под произносимый звук прямо во время формирования кадров.
Линейку разделили на две весовые категории под разные задачи и мощности. Компактная Kandinsky 6.0 Video Lite получила 3 миллиарда параметров — это быстрый черновик для поиска композиции, раскадровок и оперативной проверки гипотез на умеренном железе. Старшая Kandinsky 6.0 Video Pro насчитывает 29 миллиардов параметров. Она берёт на себя сложную физику движения, проработку мимики и глубокую детализацию сцены.
Базовая генерация выдаёт рабочий черновик, но для полноценного продакшена исходного разрешения мало. Чтобы довести картинку до стандарта Full-HD (1920×1080), разработчики собрали отдельный пайплайн видеосуперразрешения (VSR). Он работает в экосистеме Diffusers и построен на тайловой диффузии внутри латентного пространства видео-VAE.
Архитектура пайплайна суперразрешения
Модуль апскейла разбит на несколько связных блоков, каждый из которых отвечает за свою часть пространственно-временной интерполяции:
| Компонент | Класс | Параметры | Назначение |
|---|---|---|---|
transformer/ | Kandinsky6SRTransformer3DModel | 1,41 млрд | Flow-matching SR DiT (4 шага Эйлера на тайл) |
vae/ | Kandinsky6SRVAE | 1,74 млрд | Фирменная видео-VAE из общего бандла |
latent_upscaler/ | Kandinsky6SRLatentUpscalerBank | 3,65 млрд | Банк латентных апскейлеров с коэффициентами x2 и x4 |
scheduler/ | FlowMatchEulerDiscreteScheduler | — | Базовый шедулер пакета Diffusers со сдвигом shift = 5.0 |
Пайплайн VSR представлен в двух практических конфигурациях. Стандартный flow-matching бандл из основного репозитория опирается на четыре шага Эйлера на каждый тайл. Для продакшенов с плотным дедлайном подготовили дистиллированную версию под названием π-Flow (Kandinsky-6.0-VSR-distilled2steps-5s-Diffusers). Ей требуется всего две оценки модели на тайл, что ощутимо срезает время финального рендера.
На этапе инференса пайплайн требует грамотной инженерной подготовки. Чтобы развернуть его локально через библиотеку Diffusers, понадобится оптимизация компиляции PyTorch Inductor с флагом max_autotune = True, а также бэкенд внимания flex. Система масштабирует картинку гибко: параметр resolution_scale принимает множители 2, 2.25 или 4.
Здесь кроется важная производственная оговорка, которую стоит учитывать арт-директорам и супервайзерам графики. Встроенный пайплайн суперразрешения в Diffusers изолированно обрабатывает только видеоряд. Аудиодорожка высокой четкости 44 кГц создаётся на первом этапе генерации вместе с черновым видео, поэтому после апскейла картинки исходный звук подмешивается в готовый контейнер Full-HD отдельной командой микширования.
Для моушн-дизайнеров и агентств это заметный сдвиг парадигмы. Раньше аудио в генеративной графике оставалось второсортным придатком, который собирали на стороне саунд-дизайнеры. Теперь пятисекундный шот рождается сразу цельным аудиовизуальным фрагментом, готовым для быстрого монтажа или тестирования в сторис и рекламе. Сводить артикуляцию вручную больше не придётся.


