Команда Lightricks выпустила открытую видео- и аудиомодель LTX-2.5 на 22 миллиарда параметров. Архитектура получила полностью новый диффузионный видеодекодер, что означает заметное снижение количества артефактов при генерации движения. При этом в качестве текстового энкодера теперь используется Gemma 4 12B с отдельным модулем автоматического улучшения промптов.
Обновление включает улучшенный дистиллированный чекпойнт и расширенный набор данных для обучения с применением алгоритмов обучения с подкреплением (RL). В результате модель точнее интерпретирует сложные текстовые запросы и способна самостоятельно определять оптимальную длительность генерируемой сцены. Также разработчики реализовали нативную поддержку мультишота, позволяющую создавать последовательности из нескольких планов в рамках одного процесса генерации.
Базовые веса LTX-2.5, квантованные версии и инструменты для файнтюнинга уже размещены в открытом доступе. Дополнительно опубликованы сопроводительные коллекции LoRA-адаптеров и интеграция с библиотекой diffusers, что упрощает развертывание модели в локальных средах и встраивание в существующие пайплайны обработки медиа.
Поделиться:
Выпуск открытой видеомодели LTX-2.5 с поддержкой нативного multishot и RAW-воркфлоу
Изменение пользовательского соглашения и введение лимитов на скачивание в музыкальном сервисе Suno