Runway показала Worlds 2 для интерактивной генерации миров без 3D-движка

Клавиша со стрелкой вперёд толкает камеру в глубь кадра, но вместо полигональной сетки и запечённых шейдеров на экране шевелится чистый диффузионный шум. Нейросеть на лету дорисовывает перспективу переулка, меняет угол падения теней и подкладывает под шаг глухой стук гравия. Runway открыла исследовательский доступ к модели GWM Worlds 2 (General World Model). Это попытка компании отодвинуть классические игровые движки в сторону и собрать интерактивное окружение исключительно силами генеративного видео.
Новый релиз вырос из прошлогодней платформы GWM-1, которую разработчики закладывали как общий фундамент сразу под три направления: интерактивные миры (Worlds), виртуальных аватаров (Avatars) и робототехнику (Robotics). Если прежняя версия оставалась скорее демонстрацией концепции, то Worlds 2 уже выдаёт непрерывный поток картинки прямо под пальцами пользователя.

Что умеет система в реальном времени
Модель собирает интерактивную сцену со скоростью 24 кадра в секунду в разрешении 720p. Видеопоток сопровождается синхронным звуком с частотой дискретизации 48 kHz: система одновременно рассчитывает речь персонажей, точечные звуковые события и общий фоновый шум пространства, привязывая аудиоряд к происходящему на экране. Управлять происходящим можно напрямую с клавиатуры и мыши — текстовые команды назначаются на стандартные устройства ввода.

В основе Worlds 2 лежит авторегрессивная диффузионная архитектура. Каждый следующий кадр она просчитывает не с чистого листа, а опираясь на массив входящих данных:
- Стартовое текстовое описание пространства, внешности персонажей, стилистики и общей атмосферы;
- Исходный референсный кадр;
- Непрерывную предысторию всей текущей генерации;
- Актуальные команды и действия оператора.

В процессе живой сессии креатор может свободно водить виртуальную камеру по локации, вмешиваться в поведение героев, менять освещение, переключать погоду и вызывать внезапные сюжетные триггеры. Сцена не рендерится из заранее собранной сцены, а непрерывно выдумывается моделью на основании того, что происходило мгновение назад.
Слабые места и технические компромиссы
Главная особенность подхода — в архитектуре нет ни детерминированного физического движка, ни постоянного трёхмерного скелета объектов. Worlds 2 вообще не хранит координаты и 3D-состояние окружения в привычном понимании gamedev-индустрии. Из-за этого при затяжных непрерывных сессиях или резких разворотах виртуальной камеры неизбежно плывут мелкие детали, деформируется геометрия стен и перерисовываются текстуры.
Физика здесь тоже условная. Пользователь задаёт правила мира на словах — например, указывает параметры гравитации или необходимость обсчёта столкновений. Но система не рассчитывает коллизии через математические формулы, а лишь визуально экстраполирует картинку, имитируя ожидаемое поведение тел. Кроме того, на этапе исследовательского превью разработчики не заявили мульти-референсный режим: изолированно и независимо настроить персонажей, стилистику и конкретные предметы пока не выйдет.
В Runway рассчитывают, что платформа со временем пригодится авторам видеоигр, создателям цифровых героев, робототехникам и разработчикам симуляций для воплощённых агентов (embodied agents). По сути, это попытка дать креаторам универсальную песочницу для тестирования интерактивных механик без недель, потраченных на ассеты, развёртки и риггинг.
Нас подкупает сама смена оптики: вместо сборки ассетов в тяжёлых редакторах креатор получает возможность буквально режиссировать интерактивный мир на ходу. Пока это research preview с понятными визуальными артефактами и плавающей геометрией, но вектор понятен. Если раньше генеративные модели выдавали дизайнерам статичные шоты или короткие глухие видеопетли, то теперь мы держим в руках черновик полноценного симулятора реальности, где правила можно переписать одним коротким промптом прямо во время движения.


