Модель генерации видео LTX-2 пересобрали под ComfyUI с готовыми пайплайнами

Очередной пустой холст ComfyUI больше не придется вручную забивать десятками разрозненных нод, вспоминая, как подружить чужую видеомодель с кастомным планировщиком. Команда Comfy-Org взяла LTX-2, разработанную инженерами Lightricks, и упаковала её прямо в базовую экосистему со всеми сопутствующими узлами, готовыми пресетами и весами. Для тех, кто собирает генеративный моушн на локальных машинах, это редкий случай, когда сложную архитектуру отдают не в виде сырого архива, а в форме аккуратно разложенного по папкам конструктора.
Интерес к исходнику копился давно: за прошлый месяц репозиторий LTX-2 на платформе Hugging Face собрал 750 201 скачивание, а сообщество успело развернуть свыше 56 публичных пространств вроде LTX2.3-Studio и 10eros-likeness-i2v. Теперь эту популярность переводят на рельсы предсказуемой студийной работы — с картами глубины, контурным контролем и оптимизированными текстовыми энкодерами.

Архитектура и разводка по каталогам
В Comfy-Org не стали ограничиваться публикацией одного тяжелого чекпоинта. Модель разложили по правильным рабочим директориям, избавив дизайнеров от необходимости конвертировать тензоры под специфику интерфейса.
В директорию text_encoders отправились энкодеры на базе Gemma-3-12b — это адаптация большой языковой модели от Google, отвечающая за точное считывание сложных текстовых инструкций. Файлы gemma_3_12B_it.safetensors подготовили сразу в четырех форматах квантования:
- стандартный вариант без дополнительного сжатия;
- fp4_mixed для экстремальной экономии видеопамяти;
- fp8_scaled для сбалансированного соотношения скорости и четкости;
- fpmixed для кастомных конфигураций оборудования.
В соседнюю папку loras положили специализированные модификаторы. Среди них — адаптер ltx2-squish.safetensors, собранный на фундаменте ovi054/LTX-2-19b-Squish-LoRA. Он активируется триггерным словом squish it и отвечает за пластическую деформацию объектов в кадре. Рядом лежит версия LoRA для модели Gemma-3-12b-it-abliterated с рангом 64 в формате bf16 — полезная вещь, если базовые фильтры текста мешают генерировать нестандартные креативные сцены.

Семь официальных сценариев сборки
Главная практическая ценность репака — библиотека готовых рабочих процессов (workflows). Вместо экспериментов методом проб и ошибок пользователю предлагают скачать выверенные графы под конкретные продакшен-задачи:
- LTX-2: Image to Video — классическое оживление статичного кадра или концепт-арта;
- LTX-2 Text to Video — генерация непрерывного видеоряда напрямую из текстового описания;
- LTX-2 Image to Video (Distilled) — ускоренный дистиллированный вариант для быстрой раскадровки по исходному изображению;
- LTX-2 Depth to Video — генерация сцены с жесткой привязкой к карте глубины, что исключает разваливание трехмерного пространства;
- LTX-2 Canny to Video — контроль движения объектов и геометрии через распознавание контуров Canny;
- Squish Anything with LTX-2 I2V and LoRA — комбинированная связка с LoRA-модулем для физических деформаций, сжатия и растяжения предметов;
- LTX-2 Text to Video (Distilled) — дистиллированный генератор по тексту, экономящий вычислительные шаги.
Где запускать и что меняется в пайплайне
Файлы и графы выложены в открытый доступ на Hugging Face. Запустить пайплайны можно как на локальном железе с установленным ComfyUI, так и в облачной инфраструктуре — подготовлены конфигурации под запуск в Google Colab и Kaggle. Нас подкупило, что авторы репака сразу выкатили дистиллированные сборки: для коммерческого видеопроизводства время рендера драфта часто важнее идеальной детализации на первом проходе.
До сих пор работа с открытыми видеогенераторами напоминала шаманство: любая попытка направить движение камеры или удержать контур персонажа упиралась в несовместимость нод и капризы весов. С приходом подготовленных процессов Canny и Depth генерация видео в ComfyUI наконец-то получает инструменты направленной режиссуры, где движение задается точной геометрической маской, а не слепой надеждой на удачный сид.

