NVIDIA научила ИИ отличать настоящую съёмку от сгенерированной с точностью 99,3%

Редакция новостей получает отснятый ролик и должна за секунды решить: это настоящая съёмка или сгенерированная нейросетью подделка. NVIDIA утверждает, что теперь на этот вопрос отвечает алгоритм с точностью 99,3% для видео, целиком созданного текстом, и 97,7% — для роликов, оживлённых из одной картинки.
Речь про Synthetic Video Detector — один из инструментов набора NVIDIA AI for Media, который компания расширила на конференции IBC в Амстердаме. Детектор оценивает вероятность того, что кадры сгенерированы, и передаёт эту оценку дальше — редакторам, службам модерации, командам цифровой криминалистики. Систему уже встраивают в свои продукты компания Dalet — в защищённый облачный сервис проверки для новостных редакций, TwelveLabs — в новый продукт для проверки контента на соответствие региональным нормам, и Wowza, чья технология стриминга работает больше чем в 35 тысячах внедрений по 170 странам: детектор можно развернуть хоть локально, хоть в изолированном контуре без доступа в интернет.
Отдельный набор инструментов касается самого видео, а не проверки его подлинности. Video Frame Generation генерирует промежуточные кадры и увеличивает частоту кадров в 2–4 раза без потери качества — Ross Video уже встраивает эту технологию в свою платформу повторов Rio Replay, чтобы делать плавные замедленные повторы для спорта: сейчас доступно шестикратное замедление, восьмикратное — в разработке. Рядом апскейлер Video Super Resolution, который убирает шум и артефакты сжатия, и TrueHDR, конвертирующий обычное видео в HDR в реальном времени с яркостью до двух тысяч нит. Все три эффекта можно объединить в один пайплайн — удобно для студий, которые продолжают работать со старыми архивами и хотят показывать их на современных экранах.
Озвучка и движение без разметки маркерами
Для многоязычного вещания NVIDIA развивает LipSync — синхронизацию движения губ с новой звуковой дорожкой при сохранении естественных наклонов головы и мимики. Сервис NDI уже использует его для перевода в реальном времени и дубляжа с синхронизацией губ прямо внутри существующих эфирных цепочек — одна трансляция превращается в несколько языковых версий без отдельной студии на каждую.
Ещё один инструмент, 3D Body Pose, вычисляет положение суставов человека по видео с одной камеры — без датчиков захвата движения. Для спорта это трекинг перемещений игроков и биомеханика, для продакшена — материал для анимации и цифровых дублей. Vizrt уже применяет технологию в живых виртуальных студиях: движение ведущего в реальном времени управляет светом, тенями и отражениями декорации.
Отдельно NVIDIA показала Sports Intelligence Playbooks — методику дообучения открытых моделей на архиве конкретной лиги: её собственных съёмках, разметке, статистике. На тестах после такой настройки точность ответов на вопросы о матче выросла с 53 до 94%, а в открытых вопросах — с неполных 6 до 66%. Первым партнёром стала Machina Sports.
Для индустрии, которая годами настороженно относится к автоматизации монтажа и эфира, это скорее набор рабочих инструментов, чем революция: детектор подделок, апскейлер, генератор кадров и переводчик с сохранением мимики — вещи, которые нужны прямо сейчас, а не в отдалённом будущем.




