Новость

Runway показала Worlds 2 для интерактивной генерации миров без 3D-движка

The image shows a city street on a rainy day. A man in an orange vest is sweeping the sidewalk, while a woman in a green coat walks away from him. The street is lined with trees and buildings, and the wet pavement reflects the overcast sky. Fallen leaves are scattered on the sidewalk, adding a touch of autumnal color t
Фото: Runway

Клавиша со стрелкой вперёд толкает камеру в глубь кадра, но вместо полигональной сетки и запечённых шейдеров на экране шевелится чистый диффузионный шум. Нейросеть на лету дорисовывает перспективу переулка, меняет угол падения теней и подкладывает под шаг глухой стук гравия. Runway открыла исследовательский доступ к модели GWM Worlds 2 (General World Model). Это попытка компании отодвинуть классические игровые движки в сторону и собрать интерактивное окружение исключительно силами генеративного видео.

Новый релиз вырос из прошлогодней платформы GWM-1, которую разработчики закладывали как общий фундамент сразу под три направления: интерактивные миры (Worlds), виртуальных аватаров (Avatars) и робототехнику (Robotics). Если прежняя версия оставалась скорее демонстрацией концепции, то Worlds 2 уже выдаёт непрерывный поток картинки прямо под пальцами пользователя.

The image depicts a vibrant scene from the video game "GWIM Worlds 2". A large, colorful parrot, with a red body, blue and yellow wings, and a red tail, is captured in mid-flight, soaring above a lush, green landscape. The landscape features a variety of trees and vegetation, with a body of water nestled amidst the gre
Фото: Runway

Что умеет система в реальном времени

Модель собирает интерактивную сцену со скоростью 24 кадра в секунду в разрешении 720p. Видеопоток сопровождается синхронным звуком с частотой дискретизации 48 kHz: система одновременно рассчитывает речь персонажей, точечные звуковые события и общий фоновый шум пространства, привязывая аудиоряд к происходящему на экране. Управлять происходящим можно напрямую с клавиатуры и мыши — текстовые команды назначаются на стандартные устройства ввода.

The image depicts a desert landscape at sunset. The sky is filled with orange and yellow hues, creating a dramatic backdrop. In the foreground, a player's hands are visible, holding a metal flask and a spear. The player's character is wearing a brown/tan outfit. In the background, a small camp with a fire is nestled am
Фото: Runway

В основе Worlds 2 лежит авторегрессивная диффузионная архитектура. Каждый следующий кадр она просчитывает не с чистого листа, а опираясь на массив входящих данных:

  • Стартовое текстовое описание пространства, внешности персонажей, стилистики и общей атмосферы;
  • Исходный референсный кадр;
  • Непрерывную предысторию всей текущей генерации;
  • Актуальные команды и действия оператора.
The image presents a screenshot of a game's preset key bindings, displayed in a dark gray or black color scheme. The title bar at the top of the screen reads "Preset Key Bindings". The left sidebar contains a list of preset key bindings, each with a player and a default key. The right sidebar displays a list of preset
Фото: Runway

В процессе живой сессии креатор может свободно водить виртуальную камеру по локации, вмешиваться в поведение героев, менять освещение, переключать погоду и вызывать внезапные сюжетные триггеры. Сцена не рендерится из заранее собранной сцены, а непрерывно выдумывается моделью на основании того, что происходило мгновение назад.

Слабые места и технические компромиссы

Главная особенность подхода — в архитектуре нет ни детерминированного физического движка, ни постоянного трёхмерного скелета объектов. Worlds 2 вообще не хранит координаты и 3D-состояние окружения в привычном понимании gamedev-индустрии. Из-за этого при затяжных непрерывных сессиях или резких разворотах виртуальной камеры неизбежно плывут мелкие детали, деформируется геометрия стен и перерисовываются текстуры.

Физика здесь тоже условная. Пользователь задаёт правила мира на словах — например, указывает параметры гравитации или необходимость обсчёта столкновений. Но система не рассчитывает коллизии через математические формулы, а лишь визуально экстраполирует картинку, имитируя ожидаемое поведение тел. Кроме того, на этапе исследовательского превью разработчики не заявили мульти-референсный режим: изолированно и независимо настроить персонажей, стилистику и конкретные предметы пока не выйдет.

В Runway рассчитывают, что платформа со временем пригодится авторам видеоигр, создателям цифровых героев, робототехникам и разработчикам симуляций для воплощённых агентов (embodied agents). По сути, это попытка дать креаторам универсальную песочницу для тестирования интерактивных механик без недель, потраченных на ассеты, развёртки и риггинг.

Нас подкупает сама смена оптики: вместо сборки ассетов в тяжёлых редакторах креатор получает возможность буквально режиссировать интерактивный мир на ходу. Пока это research preview с понятными визуальными артефактами и плавающей геометрией, но вектор понятен. Если раньше генеративные модели выдавали дизайнерам статичные шоты или короткие глухие видеопетли, то теперь мы держим в руках черновик полноценного симулятора реальности, где правила можно переписать одним коротким промптом прямо во время движения.

Ещё новости

Все новости →