Компания Google опубликовала подборку пользовательских проектов, демонстрирующих возможности модели Gemini Omni Flash в сфере редактирования видео. Фокус смещен с генерации контента с нуля на последовательное изменение существующих сцен через текстовые или голосовые запросы. На фоне активности конкурентов в сегменте видеогенерации компания также продлила доступ к лимиту бесплатных генераций в системе, что указывает на попытку удержать внимание разработчиков к новой архитектуре.
Техническая реализация модели позволяет сохранять структурную целостность кадра при значительных изменениях перспективы или окружения. В одном из примеров исходная сцена с человеком пересобирается с 20 различных ракурсов, включая макросъемку и вид сверху, при этом физика объектов и геометрия пространства остаются согласованными. Аналогичный механизм применяется для трансформации среды, когда через голосовой ввод в реальном времени изменяются освещение, погодные условия и текстуры объектов в кадре.
Интеграция модели со средой Google Flow расширяет инструментарий за счет работы со скетчами и стилизацией. Пользовательские наброски используются для задания траектории движения статических элементов, в результате чего обычные предметы получают заданную анимацию. Механизм переноса стилей поддерживает плавные переходы между реалистичным изображением, аниме и пластилиновой анимацией внутри одного непрерывного медиапотока, что подтверждает способность нейросети удерживать контекст на протяжении всей длительности сцены.
Поделиться:
Доступ к API видеогенератора Seedance 2.5: поддержка 4K, 30-секундные ролики и мультимодальный контроль
1-битный градостроительный симулятор GlagStone в эстетике Macintosh