ЗДЕСЬ медиа
Новость

Atlas от World Labs собирает сцены из фото и держит геометрию в 1440p

The image depicts a medieval-style street scene. A knight in full armor, holding a sword, stands in the center of the street, facing the viewer. The street is lined with stone buildings, some of which have blue and white striped awnings, and features stone steps leading up to the entrances. The buildings are adorned wi
Фото: World Labs

Одно дело — скормить сетке раскадровку и надеяться, что задник не поплывет на третьем повороте. Совсем другое — получить честный пространственный слепок площадки. Команда Фей-Фей Ли из World Labs выкатила Atlas — мультимодальную модель мира, обученную с нуля сразу на тексте, видео, картинках и 3D-данных. На вход можно подать текстовый запрос для 360-градусной панорамы или пачку от одного до сотни снимков интерьера: система сведет всё в единый пространственный контекст и отдаст наружу облако точек вместе с 3D Gaussian splats.

Архитектура совмещает диффузию и авторегрессионный трансформер, удерживая трехмерное постоянство между кадрами. Atlas буквально помнит, как сцена устроена в глубину, и аккуратно достраивает слепые зоны за объектами. Для визуального продакшена это дает генерацию минутных шотов в разрешении 1440p с попиксельным управлением камерой. Нас подкупает именно эта строгость симуляции: если верить демо, при облетах ракурсы не разваливаются в кашу, а производительность растет вместе с вычислительными мощностями.

Видео: World Labs

В World Labs собираются встроить наработки в будущие версии платформы Marble. Похоже, генеративное видео наконец-то перерастает плоскую картинку и превращается в полноценный виртуальный павильон.

Видео: World Labs

Ещё новости