Odyssey-2
Интерактивная модель мира, генерирующая потоковое видео на лету по текстовым подсказкам

Обычно генерация пяти секунд видео отнимает пару минут томительного ожидания рендера. Odyssey-2 ломает привычный пайплайн: модель отдает кадр каждые 50 миллисекунд, транслируя непрерывный видеоряд со скоростью 20 кадров в секунду прямо на экран устройства. Здесь видео перестает быть заранее записанным файлом. Вы печатаете текст, а картинка перестраивается и откликается прямо на глазах, словно в диалоге с языковой моделью.
В основе системы лежит причинно-следственная авторегрессионная архитектура. Чтобы обеспечить управляемость, разработчики отказались от двунаправленных моделей с фиксированным финалом. Odyssey-2 формирует следующий кадр исключительно на базе предыдущих кадров и ваших действий. За счет этого нейросеть начинает имитировать физику окружающего мира: понимает движение волн, скольжение бликов, распределение света и поведение объектов при столкновении.
Что умеет
- Транслировать непрерывный видеопоток продолжительностью в несколько минут с частотой 20 кадров в секунду.
- Изменять сюжет, динамику и окружение на лету в ответ на текстовые команды пользователя.
- Выдавать готовый кадр быстрее 50 миллисекунд без долгой предварительной сборки.
- Воспроизводить поведение физических сред, включая инерцию, оптику и гидродинамику поверхностей.
Цены и доступ
Модель доступна в виде интерактивного веб-опыта. Разработчики готовят к запуску собственный API для внедрения технологии в сторонние сервисы, однако тарифные сетки и условия коммерческого доступа пока не раскрыты.
Такой формат оценят арт-директора, концепт-художники и специалисты по интерактивным медиа. Возможность вмешиваться в кадр без перезапуска многоминутного рендера дает совершенно другое ощущение контроля над динамической сценой.
