HunyuanWorld-Mirror
Реконструкция честной 3D-геометрии и гауссианов по набору кадров за один прямой проход нейросети
Скормить нейросети пачку сырых кадров или видеопроходку и сразу забрать готовую геометрию — без многочасовых расчётов традиционной фотограмметрии. HunyuanWorld-Mirror решает именно эту задачу: архитектура за один прямой проход восстанавливает пространственную структуру сцены, рассчитывая положение камер, карты глубин, нормали поверхностей и полноценные 3D-гауссианы.
Что умеет
- Комплексный 3D-вывод за один шаг. Модель одновременно строит мировое облако точек, глубину кадра, ориентацию поверхностей и матрицы положения камер с коэффициентами уверенности для каждой точки.
- Генерация 3D Gaussian Splatting. На выходе формируются координаты центров, прозрачность, масштабы, кватернионы вращения и сферические гармоники, готовые для отрисовки новых ракурсов через движок gsplat.
- Поддержка геометрических подсказок. Если уже известны параметры калибровки, точные ракурсы или карты глубин, механизм Multi-Modal Prior Prompting превращает их в токены и учитывает при генерации.
- Экспорт в рабочие пайплайны. Встроенные скрипты умеют визуализировать геометрию, экспортировать параметры камер и гауссианы в формат COLMAP, а также запускать дополнительную оптимизацию 3DGS.
- Работа с видео и пачками фото. Модель сама нарезает входной ролик с нужным шагом кадров и масштабирует материалы под рабочее разрешение.
Доступ
Веса модели и исходный код открыты. Запустить тест со своими кадрами можно без локальной сборки — через онлайн-демо на Hugging Face Spaces. Для развёртывания на рабочей машине подготовлен локальный интерфейс Gradio, рассчитанный на связку PyTorch и CUDA 12.4.
Инструмент пригодится моушн-дизайнерам, концепт-художникам и специалистам по визуальным эффектам, которым нужно быстро вытащить геометрию локации из видеоряда или превратить съёмку в интерактивный объём. По-нашему, это отличный повод сократить рутину трекинга до пары команд в терминале.


