Atlas от World Labs собирает сцены из фото и держит геометрию в 1440p

Одно дело — скормить сетке раскадровку и надеяться, что задник не поплывет на третьем повороте. Совсем другое — получить честный пространственный слепок площадки. Команда Фей-Фей Ли из World Labs выкатила Atlas — мультимодальную модель мира, обученную с нуля сразу на тексте, видео, картинках и 3D-данных. На вход можно подать текстовый запрос для 360-градусной панорамы или пачку от одного до сотни снимков интерьера: система сведет всё в единый пространственный контекст и отдаст наружу облако точек вместе с 3D Gaussian splats.
Архитектура совмещает диффузию и авторегрессионный трансформер, удерживая трехмерное постоянство между кадрами. Atlas буквально помнит, как сцена устроена в глубину, и аккуратно достраивает слепые зоны за объектами. Для визуального продакшена это дает генерацию минутных шотов в разрешении 1440p с попиксельным управлением камерой. Нас подкупает именно эта строгость симуляции: если верить демо, при облетах ракурсы не разваливаются в кашу, а производительность растет вместе с вычислительными мощностями.
В World Labs собираются встроить наработки в будущие версии платформы Marble. Похоже, генеративное видео наконец-то перерастает плоскую картинку и превращается в полноценный виртуальный павильон.

