Новость

Image-blaster превращает одну фотографию в готовую трехмерную сцену со звуком

The image depicts a cozy cabin nestled in a snowy forest. The cabin is constructed from wood, giving it a rustic charm. The cabin features a sloping roof and large windows that offer a view of the snowy forest. The cabin is furnished with a sofa, a coffee table, and a fireplace, creating a warm and inviting atmosphere.
Фото: GitHub

Обычный плоский кадр отправляется в терминал, вы отходите налить кофе, а через пять минут возвращаетесь к интерактивной локации, наполненной геометрией, текстурами и живым шумом окружения. Разработчик neilsonnn представил проект image-blaster — надстройку на стыке интерфейса Claude, сервисов World Labs и платформы FAL. Система забирает одну статичную фотографию и меньше чем за пять минут собирает из неё черновой трёхмерный мир, готовый к выгрузке в рабочие пакеты.

Инструмент задуман как быстрый трамплин для 3D-дизайнеров, игровых разработчиков и авторов интерактивного контента. Вместо долгой ручной сборки блокаута на основе референса скрипт автоматически размечает сцену, очищает планы, генерирует сетки отдельных предметов и накладывает звук. Чтобы конвейер ожил, понадобятся собственные API-ключи от World Labs и FAL.

Что оказывается в рабочей папке

На выходе image-blaster отдает цельный набор ассетов, который разделен на логические слои:

  • Трехмерные модели объектов в форматах .glb и .obj — скрипт вычленяет динамические предметы с исходного кадра и превращает их в самостоятельные меши.
  • Гауссовы спляты в формате .spz — они отвечают за рендеринг статичного фонового пространства и сохраняют исходное освещение.
  • Звуковая дорожка в .mp3 — закольцованный фоновый эмбиент окружения вместе с точечными физическими звуковыми эффектами под конкретные объекты на сцене.

Ансамбль нейросетей под капотом

Главная находка neilsonnn — слаженная связка узкоспециализированных моделей, где каждая решает ровно одну задачу. Для генерации исследуемого объема по умолчанию задействована модель Marble 1.1 от World Labs. Она восстанавливает геометрию окружения и строит трехмерную панораму.

За подготовку исходника отвечают инструменты редактирования изображений. По умолчанию разметку и очистку планов выполняет модель nano-banana, но в качестве альтернативы автор предусмотрел интеграцию gpt-image-2. Они стирают лишние детали, подготавливая чистые текстурные референсы для генерации геометрии.

Отдельные объекты генерирует Hunyuan 3D через облачную инфраструктуру FAL. За звуковую картину отвечает сервис ElevenLabs с моделью elevenlabs-sfx — она подбирает акустический фон под визуальный контекст, будь то уличный гул или эхо закрытого помещения.

Тонкая настройка сетки и материалов

Параметры генерации моделей через Hunyuan 3D можно переопределять прямо через флаги командной строки:

  • --face-count: устанавливает целевое количество полигонов в диапазоне от 40 000 до 1 500 000 граней. В оригинальном API Hunyuan базовое значение равно 500 000, однако в image-blaster автор выставил по умолчанию 50 000 полигонов — чтобы модели не перегружали вьюпорт и быстрее запекались.
  • --enable-pbr: управление генерацией материалов с физически корректным рендерингом. По умолчанию флаг активен (true).
  • --generate-type: определяет формат геометрии. Доступен стандартный режим Normal с текстурами (включен по умолчанию), оптимизированный LowPoly с пониженной плотностью сетки и технический Geometry для выгрузки чистой белой болванки.
  • --polygon-type: способ триангуляции для режима LowPoly. Можно выбирать между треугольной сеткой (triangle, значение по умолчанию) и четырехугольной (quadrilateral).

Сгенерированный пак легко импортируется в рабочие среды разного масштаба. В кинопроизводстве и рекламе такой сетап экономит часы на этапе скаутинга локаций и сборки мудбордов, в геймдеве — закрывает задачу быстрого прототипирования уровней. Полученные файлы напрямую принимают игровые движки Unreal Engine, Unity и Godot, классические редакторы Blender, Maya и 3DS Max, а также легковесные веб-стеки на Three.js и Electron. Помимо чисто визуальных индустрий связку можно использовать для архитектурной визуализации и обучения алгоритмов в робототехнике, где требуется быстро наполнять виртуальные полигоны окружением.

Нас подкупило, как прагматично собрана эта цепочка: автор не пытается решить все задачи одной нейросетью-гигантом, а берет сильные стороны существующих систем и связывает их прямым пайплайном. Дизайнеру больше не нужно вручную резать коллажи, вытягивать карты глубин и отдельно искать шум ветра в звуковых библиотеках. Набросок будущей сцены теперь собирается раньше, чем остынет кофе.

Ещё новости

Все новости →