Очередная система обещает радикально ускорить пайплайн создания 3D-персонажей. Проект SHELLS от исследователей Google заявляет генерацию сетки лица на 18 тысяч вершин всего за 0.08 секунды. Цифры выглядят солидно, особенно вместе со снижением потребления видеопамяти на 88% по сравнению с типичными объемными методами. Кажется, перед нами практичный инструмент для массового продакшена. Но так ли все гладко за пределами лабораторных тестов?
Главный нюанс кроется в жестких требованиях к входным данным. Для достижения заявленной скорости системе нужны строго откалиброванные многоракурсные камеры с известными параметрами. Под капотом SHELLS уходит от привычной ресурсоемкой локальной обработки вершин. Извлечение признаков поручили DinoV2, после чего алгоритм строит грубую базовую сетку. Эта черновая форма работает как каркас для финальной детальной выборки. Такое разделение на слои действительно разгружает память и позволяет трансформеру сохранять консистентность топологии.
По сути, это узкоспециализированное решение для студийного захвата мимики, а не универсальный генератор. Разработчики делают акцент на том, что модель обучалась только на синтетике, но при этом справляется с окклюзиями вроде внутренней полости рта на реальных кадрах. Заявлена даже работа с двумя ракурсами. Правда, перенос этого синтетического опыта на реальную площадку вызывает закономерные сомнения. Любая погрешность в калибровке оптики может легко сломать алгоритм, который слишком сильно опирается на идеальную математику проекций.
Поделиться:
CGI и 3D-моушн в коммерции: разбор портфолио арт-директора Пола Вайнера
Быстрый старт в 3D-моушене: граница между ремеслом и арт-дирекшном