Нейросеть ldraw-nova проектирует физически собираемые модели LEGO

Обычные трехмерные диффузионные генераторы выдают красивую, но бесполезную для сборки кашу: полигоны слипаются, детали врастают друг в друга, а внутри объекта царит геометрическая пустота. Разработчик под ником anteloc подошел к задаче с инженерной стороны и выпустил ldraw-nova — открытую систему для автономных ИИ-агентов, которые проектируют реальные, физически устойчивые конструкции из кирпичиков LEGO. На выходе получается не просто рендер, а готовый САПР-чертеж, где учтен каждый пластиковый шип и каждый миллиметр зазора.
В основе инструмента лежит язык LDraw — ветеранский ассемблер для трехмерного моделирования конструктора, который десятилетиями использует сообщество. Вместо того чтобы заставлять нейросеть рисовать полигональную сетку вслепую, ldraw-nova поручает агенту роль ведущего инженера-проектировщика. Система берет короткий текстовый запрос от пользователя и превращает его в физически корректный объект через серию строгих шагов.
Как агент собирает конструктор
Рабочий цикл строится на цепочке вспомогательных скриптов и визуального самоконтроля. Агент получает задание и сверяется со встроенной инструкцией instructions.md, а также технической документацией формата LDraw. Дальше процесс идет по строгому сценарию:
- Составляется верхнеуровневый план в формате JSON — к примеру,
atlas-crane.plan.json, где прописывается геометрия, состав базовых модулей и необходимые строительные элементы. - На основе этого плана агент пишет код на Python (
generate.py), который математически точно расставляет кирпичики и формирует исходник модели в формате.mpd. - Запускается так называемый headless-рендеринг: система генерирует технические снимки промежуточных этапов сборки.
- Агент изучает получившиеся изображения, оценивает общую эстетику, выявляет коллизии или смещения и циклично правит код до тех пор, пока модель не станет цельной.
Чтобы нейросеть не придумывала несуществующие кирпичики и не ошибалась в типоразмерах, в пайплайн встроен поисковый движок jev-rerank на базе моделей TypeSafe Jev System One. Он подбирает нужные компоненты по семантическому описанию. Для работы этого модуля требуется ключ TYPESAFE_API_KEY, но разработчик предусмотрел страховку: если ключа нет, система автоматически переключается на стандартный полнотекстовый поиск FTS. В процессе агент также рассчитывает взаимные зазоры между деталями и блокирует любые пересечения твердых тел.
Опыт прошлых ошибок и ставка на код
К этой архитектуре автор пришел не сразу. За плечами anteloc осталась серия ранних экспериментов: проект ldbuilder-ai, а также библиотеки py2bricks и py4bricks. Главный вывод тех проб оказался парадоксальным: языковые модели категорически плохо справляются с непосредственным расчетом сложной пространственной тригонометрии, углов вращения и матриц трансформаций внутри формата LDraw.
Зато LLM великолепно пишут код на Python, вычисляющий эту же самую геометрию через формулы и циклы. Эксперименты показали, что обучать нейросети созданию моделей гораздо продуктивнее именно на скриптах-генераторах, чем скармливать им готовые финальные файлы конструкций.
Что получает дизайнер на выходе
После того как агент завершит проверку прочности и состыкует последний элемент, проект выдает целый набор рабочих ассетов:
- Исходный файл
.mpdна языке LDraw для профильных САПР. - Готовый к импорту файл
.glb(glTF) для работы в Blender, причем все пользовательские свойства и метаданные деталей аккуратно сохраняются в Custom Properties. - Пакет визуализаций: статичные рендеры, интерактивный веб-плеер, 3D-просмотрщик и готовую VR-сцену для гарнитуры Meta Quest 3.
- Полный лог рассуждений ИИ с историей чата, по которому можно отследить инженерную логику агента.
Для моушн-дизайнеров и визуализаторов здесь открывается редкая возможность: получить процедурно собранную, семантически размеченную трехмерную сцену из кубиков прямо под верстку или анимацию ролика, минуя ручную сборку сотен элементов руками в Studio или Blender.
Запуск и технические требования
Система полностью автономна и разворачивается локально. Потребуются Git, Docker и около 5 ГБ свободного места на жестком диске. Для корректной сборки нужно клонировать два связанных репозитория — ldraw-nova и ldraw-nova-docker, обязательно переключив их на одинаковую ветку или релизный тег v0.6.0.
Запуск выполняется классической командой docker compose up -d. После инициализации контейнер открывает два сетевых порта:
http://localhost:8765— стандартный HTTP-интерфейс без лишних предупреждений браузера о сертификатах (VR-режим на этом порту отключен).https://localhost:8443— защищенный интерфейс с самоподписанным SSL-сертификатом, необходимый для трансляции интерактивного окружения в WebXR на гарнитуру Meta Quest 3.
Детские болезни и планы развития
Инструмент пока находится в статусе первой версии, и ограничений у него хватает. Нас подкупила честность автора: он прямо указывает, что качественную сборку сейчас способны выдать только флагманские модели уровня GPT-4 или Claude. Попытки подключить более легковесные или дешевые LLM вроде Haiku или Luna приводят к геометрическим сбоям и удорожают итоговые генерации из-за бесконечных итераций исправления.
Кроме того, рендеринг в Meta Quest 3 требует серьезной полировки по части стабильности и частоты кадров. В дорожной карте проекта значатся оптимизация скорости генерации, расширение библиотек для корректной сборки космических кораблей, техники со сложной механикой и добавление минифигурок людей и животных. Отдельный амбициозный шаг — научить агента самостоятельно собирать модели, распознавая отсканированные страницы старых бумажных инструкций.
Когда ИИ перестает фантазировать пикселями и начинает рассуждать языком физических допусков, генеративная графика наконец нащупывает контакт с материальным миром.


