Команда LTX выпустила открытую видеомодель LTX-2.5 на 22 млрд параметров. В основе архитектуры лежит новый диффузионный видеодекодер, который снижает количество артефактов в движении, а за обработку текстовых запросов отвечает энкодер Gemma 4 12B в связке с кастомным алгоритмом улучшения промптов. Модель поставляется с открытыми весами, что позволяет запускать ее локально на потребительских видеокартах с 16 ГБ видеопамяти и дообучать архитектуру на собственных датасетах.
Ключевым отличием версии стала функция нативного multishot-генерирования, при котором система сохраняет консистентность персонажей, окружения и освещения между разными планами в рамках одного прохода. Кроме того, LTX-2.5 получила поддержку экспорта в формате EXR и нативного 4K HDR, что обеспечивает прямую интеграцию с профессиональными пайплайнами цветокоррекции без потери качества исходника. Алгоритм также способен самостоятельно определять оптимальную длительность видеоряда в зависимости от запрашиваемого в промпте действия.
Обновленный дистиллированный чекпоинт и использование обучения с подкреплением на расширенном датасете позволили кратно ускорить процесс синтеза. При локальном развертывании генерация десятисекундного ролика занимает 6.8 секунды, что делает возможным использование системы в интерактивных задачах реального времени, при этом открытые веса на HuggingFace распространяются без жестких ограничений на коммерческое использование или обязательного брендирования.
Поделиться:
Вакансия: 3D Motion Designer на Unreal Engine в GameGears.Online
Изменение пользовательского соглашения и введение лимитов на скачивание в музыкальном сервисе Suno