Новость

Модель генерации видео LTX-2 пересобрали под ComfyUI с готовыми пайплайнами

The image shows a doll with curly red hair, wearing a brown sweater, holding a red umbrella. The doll's face is slightly tilted to the left, and it has a neutral or slightly sad expression. The background is blurred, suggesting an outdoor setting, possibly a garden or park, with a soft, diffused light. The doll's hands
Фото: Hugging Face

Очередной пустой холст ComfyUI больше не придется вручную забивать десятками разрозненных нод, вспоминая, как подружить чужую видеомодель с кастомным планировщиком. Команда Comfy-Org взяла LTX-2, разработанную инженерами Lightricks, и упаковала её прямо в базовую экосистему со всеми сопутствующими узлами, готовыми пресетами и весами. Для тех, кто собирает генеративный моушн на локальных машинах, это редкий случай, когда сложную архитектуру отдают не в виде сырого архива, а в форме аккуратно разложенного по папкам конструктора.

Интерес к исходнику копился давно: за прошлый месяц репозиторий LTX-2 на платформе Hugging Face собрал 750 201 скачивание, а сообщество успело развернуть свыше 56 публичных пространств вроде LTX2.3-Studio и 10eros-likeness-i2v. Теперь эту популярность переводят на рельсы предсказуемой студийной работы — с картами глубины, контурным контролем и оптимизированными текстовыми энкодерами.

The image presents a modern interior space, captured in a black and white photograph. The room is dominated by a white table, which appears to be the central focus. The table is surrounded by a few chairs, though their details are obscured by the soft blur. The room is illuminated by a hanging lamp, which casts a soft
Фото: Hugging Face

Архитектура и разводка по каталогам

В Comfy-Org не стали ограничиваться публикацией одного тяжелого чекпоинта. Модель разложили по правильным рабочим директориям, избавив дизайнеров от необходимости конвертировать тензоры под специфику интерфейса.

В директорию text_encoders отправились энкодеры на базе Gemma-3-12b — это адаптация большой языковой модели от Google, отвечающая за точное считывание сложных текстовых инструкций. Файлы gemma_3_12B_it.safetensors подготовили сразу в четырех форматах квантования:

  • стандартный вариант без дополнительного сжатия;
  • fp4_mixed для экстремальной экономии видеопамяти;
  • fp8_scaled для сбалансированного соотношения скорости и четкости;
  • fpmixed для кастомных конфигураций оборудования.

В соседнюю папку loras положили специализированные модификаторы. Среди них — адаптер ltx2-squish.safetensors, собранный на фундаменте ovi054/LTX-2-19b-Squish-LoRA. Он активируется триггерным словом squish it и отвечает за пластическую деформацию объектов в кадре. Рядом лежит версия LoRA для модели Gemma-3-12b-it-abliterated с рангом 64 в формате bf16 — полезная вещь, если базовые фильтры текста мешают генерировать нестандартные креативные сцены.

The image features a small, tan-colored puppy with a blue bandana around its neck. The puppy is sitting on a white surface, possibly a wall or floor, and is looking directly at the camera. Its fur appears slightly damp or wet. The puppy's front paws are visible, and it has a small, dark nose. The background is a plain
Фото: Hugging Face

Семь официальных сценариев сборки

Главная практическая ценность репака — библиотека готовых рабочих процессов (workflows). Вместо экспериментов методом проб и ошибок пользователю предлагают скачать выверенные графы под конкретные продакшен-задачи:

  • LTX-2: Image to Video — классическое оживление статичного кадра или концепт-арта;
  • LTX-2 Text to Video — генерация непрерывного видеоряда напрямую из текстового описания;
  • LTX-2 Image to Video (Distilled) — ускоренный дистиллированный вариант для быстрой раскадровки по исходному изображению;
  • LTX-2 Depth to Video — генерация сцены с жесткой привязкой к карте глубины, что исключает разваливание трехмерного пространства;
  • LTX-2 Canny to Video — контроль движения объектов и геометрии через распознавание контуров Canny;
  • Squish Anything with LTX-2 I2V and LoRA — комбинированная связка с LoRA-модулем для физических деформаций, сжатия и растяжения предметов;
  • LTX-2 Text to Video (Distilled) — дистиллированный генератор по тексту, экономящий вычислительные шаги.
Видео: Hugging Face

Где запускать и что меняется в пайплайне

Файлы и графы выложены в открытый доступ на Hugging Face. Запустить пайплайны можно как на локальном железе с установленным ComfyUI, так и в облачной инфраструктуре — подготовлены конфигурации под запуск в Google Colab и Kaggle. Нас подкупило, что авторы репака сразу выкатили дистиллированные сборки: для коммерческого видеопроизводства время рендера драфта часто важнее идеальной детализации на первом проходе.

До сих пор работа с открытыми видеогенераторами напоминала шаманство: любая попытка направить движение камеры или удержать контур персонажа упиралась в несовместимость нод и капризы весов. С приходом подготовленных процессов Canny и Depth генерация видео в ComfyUI наконец-то получает инструменты направленной режиссуры, где движение задается точной геометрической маской, а не слепой надеждой на удачный сид.

Ещё новости

Все новости