Исследователи из университета Карнеги-Меллона открыли код Lift4D — фреймворка, который собирает полноценный анимированный 3D-ассет из обычного плоского видео. В отличие от стандартной фотограмметрии или NeRF, пайплайн переваривает динамичные сцены с нежесткими деформациями и логически достраивает невидимые ракурсы на 360 градусов. Технология работает с роликами, снятыми в естественных условиях, без необходимости в сложной калибровке камер.
В основе инструмента лежит трехступенчатая архитектура, объединяющая несколько ресурсоемких моделей. На первом этапе SAM 3 сегментирует нужный объект по текстовому промпту. Затем в дело вступает Causal SAM3D, генерирующий покадровую 3D-реконструкцию с учетом карт глубины от Depth Anything 3. На финальном этапе алгоритм сливает разрозненные кадры в единую каноническую форму, используя оптимизацию на базе 3D-гауссианов и Stable Zero123 для сохранения визуальной согласованности между ракурсами.
Пока решение остается сугубо исследовательским и требует специфического железа: авторы заявляют о тестировании на видеокартах класса A100 с 40 ГБ памяти. Сборка пайплайна также потребует ручной настройки окружения и авторизации для загрузки закрытых весов. Несмотря на высокий порог входа, проект наглядно показывает, как автоматизируется извлечение сложных пространственных данных и анимаций из обычного пользовательского контента.
Поделиться:
Машинная креативность или геометрия: как нейросети рисуют по координатам
Свежий шоурил студии MOOOV: визуальные эффекты и генеративные технологии в кино