World Labs создала мировую модель Atlas и переходит под крыло AMD

Представьте, что вы берете три случайных кадра интерьера, снятых на бегу со смартфона, расставляете их в виртуальном пространстве, а нейросеть сама прокладывает между ними коридоры, выстраивает дверные проемы и рассчитывает честную геометрию окружения. Без привычного запекания мешей, долгой ручной очистки полигонов и возни с трекингом маркеров. Стартап World Labs, основанный в 2024 году пионером компьютерного зрения Фей-Фей Ли, показал модель Atlas — мультимодальную систему, которая превращает разрозненные плоские изображения в цельный трехмерный мир.
Почти одновременно с анонсом пришла новость о масштабной сделке: компанию World Labs покупает процессорный гигант AMD. Их совместная работа началась еще годом ранее, когда инженеры стартапа взялись за оптимизацию обучения и вывода пространственных моделей на «красных» видеокартах. Теперь союз оформили юридически. Фей-Фей Ли займет в AMD кресла исполнительного вице-президента и главного научного сотрудника, подчиняясь напрямую главе корпорации Лисе Су. Непосредственное руководство командой World Labs сохранят за собой Джастин Джонсон и Бен Милденхолл. Закрытие сделки намечено на конец 2026 года после одобрения регуляторов, а ее главная цель — выстроить открытую экосистему, соединяющую кремний, базовые модели и софт.

Архитектура живого пространства
В основе Atlas лежит авторегрессионный диффузионный трансформер, обученный с нуля на потоках выпрямления (rectified flows). Разработчики объединили архитектурные принципы больших языковых моделей и диффузионных генераторов видео. Система воспринимает кадры не как изолированные пиксельные матрицы, а как последовательность элементов, привязанных к жесткой системе координат и позам виртуальных камер в пространстве.
Каждое входящее изображение сопровождается расчетом карты глубины. Модель пошагово генерирует новые элементы с опорой на накопленный контекст, используя современный стек оптимизаций: от распределенного инференса и классификаторного наведения (classifier-free guidance) до дистилляции диффузии и продвинутой маршрутизации KV-кэша. Архитектура спроектирована с прицелом на прямое масштабирование: чем больше вычислительных мощностей вливают на этапе предварительного обучения, тем стабильнее растет качество выходной геометрии.
От рендеринга до робототехники
Atlas ляжет в основу будущих версий фирменной платформы Marble и уже сейчас закрывает ключевые сценарии визуального продакшена и симуляции:
- Кинематографический контроль камеры: модель собирает видеоролики хронометражем до 1 минуты в честном разрешении 1440p всего по 1–6 исходным кадрам. Камера строго слушается траектории: можно задать плавное панорамирование, наезд или сложный пролет операторского крана. На слепых тестах независимые эксперты подтвердили: Atlas превосходит существующие видеомодели по точности следования траекториям, и этот отрыв становится заметнее при усложнении движения.
- Пространственная реконструкция: для воссоздания реальной локации — будь то университетский кампус в Стэнфорде или заросший сад — модели требуется от 2–3 до сотни с лишним снимков. Если ракурсов не хватает, включается пространственное воображение, заполняющее слепые зоны. При избытке кадров гарантируется физическая точность. На выходе получаются не просто плоские рендеры, а облака точек (point clouds) и 3D Gaussian splats, готовые к показу в реальном времени.
- Эффект Bullet Time на коленке: для застывшего облета сцены со сменой угла обзора постфактум достаточно синхронной съемки на 3–5 обычных мобильных телефонов.
- Перенос физики в симуляцию (Real-to-Sim): генерация RGB-картинок и сенсорных карт глубины для автономных роботов, включая манипуляции с твердыми, сочлененными и деформируемыми объектами.
- Генерация 360-панорам и графика: поддержка сложных текстовых подсказок, рендеринг шрифтов и бесшовные сферические панорамы в любых стилях.
В задачах трехмерной реконструкции по разреженным кадрам Atlas уже обходит специализированные открытые аналоги. Для арт-директоров и моушн-дизайнеров это сигнал о тектоническом сдвиге: грань между плоской раскадровкой и интерактивной сценой окончательно стирается. Собрать черновой сетап ролика, утвердить ракурсы камеры и выгрузить гауссовы сплэты в рендер-движок можно будет за считаные минуты прямо из мудборда.
Пространственный интеллект наконец-то перестал быть академическим термином и получил координаты в реальном софте




