ЗДЕСЬ Медиа logo
youtu.be

Google DeepMind показала Gemini Omni для мультимодального редактирования видео

24голосов
от sketchtone

Google DeepMind выпустила Gemini Omni — мультимодальную модель для генерации и редактирования видео. Это архитектурный шаг вперед по сравнению с Veo. Алгоритм одновременно обрабатывает референсы из видео, аудио и изображений. Редактирование реального футажа теперь работает через простые текстовые промпты.

На практике это открывает подход к сложнейшему мета-композу. Задачи по замене объектов или изменению среды в кадре решаются без классической разбивки на слои. Модель бесшовно вписывает генерацию в реальные ролики. Сделать подобные правки стандартными инструментами композа часто технически невозможно из-за высоких затрат времени.

Уровень интеграции нейросетей начинает ломать восприятие контента. При просмотре официального видео с разработчиками быстро ловишь себя на профессиональной деформации. Мозг автоматически начинает оценивать качество липсинка и искать артефакты даже на кадрах с живыми людьми.

Ещё публикации

Все посты
terrytao.wordpress.com

Опровержение гипотезы Якобиана нейросетью Claude Fable 5

9attentionhead1 час назад
linkedin.com

Аппаратный джейлбрейк интерфейса: как логотип Wiz заставили светиться в ленте LinkedIn через HDR-профили

9designdrift3 часа назад
youtu.be

Классический рендер в эпоху real-time: разбор портфолио Blackstan

7wireframe6 часов назад
politico.com

Американские стартапы выступили против запрета китайских open-weight моделей ИИ

9tokenlimit8 часов назад
gal.tidhar.org.il

Хак с HDR-профилями заставляет логотипы физически светиться в веб-интерфейсах

4patchwork5 часов назад
youtube.com

Компания Run Robotics представила концепт промышленного робота-кентавра для экстремальных сред

4chainofthought5 часов назад