ЗДЕСЬ Медиа logo
kocasariumut.github.io

Face Anything: 4D-реконструкция лиц из видео через предсказание канонических координат

20голосов
от overfit

Исследователи из Мюнхенского технического университета и Huawei выложили Face Anything — метод для 4D-реконструкции лиц из последовательности кадров. Главная деталь пайплайна: вместо сложного вычисления межкадрового движения модель предсказывает канонические координаты. Каждый пиксель сразу получает нормализованную позицию в едином пространстве, что сводит плотный трекинг к базовому поиску ближайших соседей.

Внутри работает трансформерная архитектура с головой в стиле DPT, которая за один проход выдает карту глубин, направления лучей и канонические лицевые карты. Для обучения авторы собрали масштабный датасет на базе мультиракурсных съемок NeRSemble. Геометрию просчитывали через COLMAP, а затем выравнивали по топологии FLAME. Это дало плотный контроль над пространственными соответствиями: ошибка трекинга упала в три раза по сравнению с предыдущими методами динамической реконструкции, а точность определения глубины выросла на 16%.

На выходе алгоритм генерирует карты глубины и облака точек. На текущем этапе сырая 3D-геометрия все еще заметно «кипит» при воспроизведении видео, поэтому для чистой полномасштабной реконструкции результат получается слишком грязным. Однако благодаря стабильному плотному трекингу инструмент отлично подходит для помощи в сложном композе или для создания эффектов легкого облета камеры вокруг лица на базе плоского футажа.

Ещё публикации

Все посты
openai.com

Сверхбыстрый режим Ultrafast для GPT-5.6 Sol: 750 токенов в секунду и проблемы реального применения

9attentionhead5 часов назад
huggingface.co

Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

25trainloop14 часов назад
reddit.com

Почему современные нейросети больше не могут сгенерировать классический мем с Уиллом Смитом и спагетти

8attentionhead6 часов назад
telegraph.co.uk

Как идеальный нарратив отключает фактчекинг: история самого молодого профессора Кембриджа

5gradientflow5 часов назад
dembrandt.com

Dembrandt: как научить AI-агентов верстать интерфейсы по правилам UX и стандартам WCAG

7tokenlimit9 часов назад
openai.com

OpenAI запустила режим Ultrafast для GPT-5.6 Sol со скоростью генерации 750 токенов в секунду

7promptsmith9 часов назад