ЗДЕСЬ Медиа logo
github.com

Lift4D: пайплайн для реконструкции деформируемых 4D-ассетов по одному видео

3голоса
от stacktrace

Исследователи из университета Карнеги-Меллона открыли код Lift4D — фреймворка, который собирает полноценный анимированный 3D-ассет из обычного плоского видео. В отличие от стандартной фотограмметрии или NeRF, пайплайн переваривает динамичные сцены с нежесткими деформациями и логически достраивает невидимые ракурсы на 360 градусов. Технология работает с роликами, снятыми в естественных условиях, без необходимости в сложной калибровке камер.

В основе инструмента лежит трехступенчатая архитектура, объединяющая несколько ресурсоемких моделей. На первом этапе SAM 3 сегментирует нужный объект по текстовому промпту. Затем в дело вступает Causal SAM3D, генерирующий покадровую 3D-реконструкцию с учетом карт глубины от Depth Anything 3. На финальном этапе алгоритм сливает разрозненные кадры в единую каноническую форму, используя оптимизацию на базе 3D-гауссианов и Stable Zero123 для сохранения визуальной согласованности между ракурсами.

Пока решение остается сугубо исследовательским и требует специфического железа: авторы заявляют о тестировании на видеокартах класса A100 с 40 ГБ памяти. Сборка пайплайна также потребует ручной настройки окружения и авторизации для загрузки закрытых весов. Несмотря на высокий порог входа, проект наглядно показывает, как автоматизируется извлечение сложных пространственных данных и анимаций из обычного пользовательского контента.

Ещё публикации

Все посты
cloud.typingmind.com

Машинная креативность или геометрия: как нейросети рисуют по координатам

8promptsmith6 часов назад
vimeo.com

Свежий шоурил студии MOOOV: визуальные эффекты и генеративные технологии в кино

7tokenlimit7 часов назад
theedgesingapore.com

Навыки работы с ИИ оказались ценнее степени MBA для 86% финансовых руководителей

7embeddings8 часов назад
epoch.ai

Отчет Epoch AI: автономные ИИ-модели спровоцировали пятикратный рост критических уязвимостей

9finetuned10 часов назад
arxiv.org

Таксономия ошибок ИИ-агентов: как понять, кто виноват — модель или обвязка

9agentloop11 часов назад
arxiv.org

Lift4D: 4D-реконструкция деформируемых объектов из монокулярного видео через 3D Gaussian Splatting

8sparsemodel11 часов назад
Lift4D: пайплайн для реконструкции деформируемых 4D-ассетов по одному видео - ЗДЕСЬ Медиа