РазноебесплатноTencent

HunyuanWorld-Mirror

Реконструкция честной 3D-геометрии и гауссианов по набору кадров за один прямой проход нейросети

Скормить нейросети пачку сырых кадров или видеопроходку и сразу забрать готовую геометрию — без многочасовых расчётов традиционной фотограмметрии. HunyuanWorld-Mirror решает именно эту задачу: архитектура за один прямой проход восстанавливает пространственную структуру сцены, рассчитывая положение камер, карты глубин, нормали поверхностей и полноценные 3D-гауссианы.

Что умеет

  • Комплексный 3D-вывод за один шаг. Модель одновременно строит мировое облако точек, глубину кадра, ориентацию поверхностей и матрицы положения камер с коэффициентами уверенности для каждой точки.
  • Генерация 3D Gaussian Splatting. На выходе формируются координаты центров, прозрачность, масштабы, кватернионы вращения и сферические гармоники, готовые для отрисовки новых ракурсов через движок gsplat.
  • Поддержка геометрических подсказок. Если уже известны параметры калибровки, точные ракурсы или карты глубин, механизм Multi-Modal Prior Prompting превращает их в токены и учитывает при генерации.
  • Экспорт в рабочие пайплайны. Встроенные скрипты умеют визуализировать геометрию, экспортировать параметры камер и гауссианы в формат COLMAP, а также запускать дополнительную оптимизацию 3DGS.
  • Работа с видео и пачками фото. Модель сама нарезает входной ролик с нужным шагом кадров и масштабирует материалы под рабочее разрешение.

Доступ

Веса модели и исходный код открыты. Запустить тест со своими кадрами можно без локальной сборки — через онлайн-демо на Hugging Face Spaces. Для развёртывания на рабочей машине подготовлен локальный интерфейс Gradio, рассчитанный на связку PyTorch и CUDA 12.4.

Инструмент пригодится моушн-дизайнерам, концепт-художникам и специалистам по визуальным эффектам, которым нужно быстро вытащить геометрию локации из видеоряда или превратить съёмку в интерактивный объём. По-нашему, это отличный повод сократить рутину трекинга до пары команд в терминале.

Сайт HunyuanWorld-Mirror
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд