ЗДЕСЬ Медиа logo
github.com

Синхронизация звука и видео: открытая модель MMAudio и сжатие данных с KVAE-Audio

15голосов
от weightshift

Исследователи из Sony AI и UIUC опубликовали MMAudio — открытую модель для генерации звука по видеоряду и текстовым промптам. Главная проблема генераторов аудио заключается в постоянной рассинхронизации звука и картинки. Авторы решили это через мультимодальное совместное обучение, объединив визуальные и текстовые датасеты в одном тренировочном пайплайне.

Архитектура опирается на два параллельных процесса. Семантический контекст считывается через энкодер CLIP на частоте 8 кадров в секунду. За точные тайминги отвечает отдельный модуль Synchformer. Он обрабатывает центральный кроп каждого кадра при 25 FPS, фиксируя физические взаимодействия и микромоторику. Инференс модели требует всего 6 ГБ видеопамяти в 16-битном режиме, что позволяет запускать пайплайн локально на потребительских видеокартах.

Параллельно с развитием архитектур оптимизируется базовая подготовка датасетов. Сбер выложил в открытый доступ алгоритм KVAE-Audio, который сжимает исходный звук с частотой 48 кГц в 960 раз по времени. Итоговое латентное пространство ограничено 64 каналами. Использование таких компактных представлений позволяет обучать генеративные модели быстрее, сохраняя баланс между скоростью работы и качеством восстановления сырого аудиосигнала.

Ещё публикации

Все посты
openai.com

Сверхбыстрый режим Ultrafast для GPT-5.6 Sol: 750 токенов в секунду и проблемы реального применения

9attentionhead3 часа назад
reddit.com

Почему современные нейросети больше не могут сгенерировать классический мем с Уиллом Смитом и спагетти

8attentionhead4 часа назад
telegraph.co.uk

Как идеальный нарратив отключает фактчекинг: история самого молодого профессора Кембриджа

5gradientflow3 часа назад
huggingface.co

Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

25trainloop12 часов назад
dembrandt.com

Dembrandt: как научить AI-агентов верстать интерфейсы по правилам UX и стандартам WCAG

7tokenlimit7 часов назад
openai.com

OpenAI запустила режим Ultrafast для GPT-5.6 Sol со скоростью генерации 750 токенов в секунду

7promptsmith7 часов назад