Очередной релиз в сфере генерации видео пытается удивить нестандартным подходом к исходным данным. Alibaba вывела в публичную бету модель Wan 3.0, способную выдавать ролики со звуком длиной до 30 секунд. Главный акцент разработчики делают на так называемой всеядности системы. Теперь нейросети можно скармливать не только промпты и картинки, но и документы форматов doc, xls, ppt и pdf размером до 100 мегабайт. Предполагается, что алгоритм проанализирует структуру файла и выдаст готовую инфографику или видеоряд.
Идея автоматизировать превращение квартальных отчетов в динамичные презентации звучит логично для корпоративного сектора. Правда, возникает резонное сомнение в качестве интерпретации сложных данных. Одно дело — анимировать простой график из таблицы, и совсем другое — заставить нейросеть вычленить смыслы из пятидесяти страниц текста без галлюцинаций. Обещанное жесткое сохранение консистентности персонажей на тридцатисекундной дистанции тоже вызывает скепсис. Текущие диффузионные архитектуры все еще имеют хроническую склонность к морфингу объектов на длинных планах.
Доступ к API уже открыт и тарифицируется посекундно. Генерация в разрешении 480p обойдется примерно в $0.04 за секунду, а за 1080p попросят около 1.2 юаня. Но пока заявленная функция создания роликов из электронных таблиц выглядит скорее как демонстрация серверных мощностей Alibaba, чем надежный пайплайн для продакшена. Вопрос в том, захотят ли пользователи платить за анимацию эксель-файлов, пока базовые проблемы с пространственной логикой в генеративном видео остаются нерешенными.
Поделиться:
Обновление шрифтовой системы Futura PT: моноширинные начертания и расширенная кириллица
Alibaba выпустила десктопный клиент Qianwen на базе Qwen 3 и открыла API видеогенератора Wan 3.0