Все привыкли считать, что главная проблема генерации 3D — получить сносную геометрию без артефактов. Но Tencent с их новым проектом Hunyuan3D-Buffalo 1.0 пытается доказать, что сетям не хватает семантического понимания сцены. Идея в том, чтобы машина не просто лепила полигоны, но и могла отвечать на вопросы о структуре модели, выделять детали и редактировать их.
Под капотом архитектура опирается на связку модуля Hunyuan3D-VLM и диффузионных блоков базового генератора Hunyuan3D-2.1. Звучит логично: сначала мы понимаем, где у персонажа рука, а потом применяем к ней целевую трансформацию. Но объединение 3D-представлений и языка часто разбивается о суровую реальность некачественной топологии сгенерированных ассетов. Если базовая сетка представляет собой кашу из треугольников, умная VLM не сможет аккуратно отделить детали без ручного вмешательства.
Правда, возможность извлекать семантические части объектов чисто текстовыми командами все равно выглядит любопытным шагом вперед. Это смещает фокус с простой слепой генерации на создание инструментов для более сложных производственных пайплайнов. Вопрос лишь в том, насколько стабильно эта сегментация работает на слипшейся геометрии, типичной для современных диффузионных моделей.
Поделиться:
Генерация видео из таблиц и PDF: Alibaba открыла публичный доступ к модели Wan 3.0
Обновление шрифтовой системы Futura PT: моноширинные начертания и расширенная кириллица