РазноебесплатноTencent Hunyuan

HY-World 2.0

Открытая система Tencent для генерации интерактивных 3D-миров и реконструкции сцен по видео

Обычно генеративные видеомодели создают плоский ролик, который растворяется сразу после окончания воспроизведения. HY-World 2.0 от команды Tencent Hunyuan идет другим путем: архитектура переводит текстовые описания, одиночные кадры или любительские видеозаписи в постоянные трехмерные пространства. На выходе вы получаете не сгенерированную анимацию, а осязаемые полигональные сетки и массивы 3D Gaussian Splatting, пригодные для интерактивной визуализации.

Что умеет

  • Генерировать миры из одного запроса. Связка алгоритмов HY-Pano 2.0 и WorldStereo 2.0 строит круговую панораму на 360 градусов, планирует маршрут камеры и разворачивает сцену в объемный ландшафт.
  • Мгновенно восстанавливать сцены. Модель WorldMirror 2.0 за один проход считывает видео или серию фотографий, вычисляя карту глубин, нормали поверхностей, параметры камер и плотное облако точек.
  • Поддерживать живую навигацию. По сгенерированным улицам и интерьерам можно ходить с видом от первого или третьего лица с учетом физических столкновений.
  • Экспортировать ассеты в движки. Готовые данные в форматах 3DGS и mesh напрямую загружаются в Blender, Unreal Engine, Unity и Isaac Sim.

Цены и доступ

Проект развивается с открытым исходным кодом: кодовая база доступна на GitHub, а веса моделей размещены на Hugging Face. Опробовать генерацию сцен также можно бесплатно через веб-демо на платформе Tencent Hunyuan. Локальный запуск ориентирован на рабочие станции с Python 3.11+ и CUDA 12.8.

Разработка пригодится левел-дизайнерам, энвайронмент-артистам и создателям виртуального продакшена, которым нужен быстрый способ превратить концепт-арт или видеозапись локации в редактируемое трехмерное пространство.

Сайт HY-World 2.0
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд