Meta Segment Anything Model Audio (SAM Audio)
Изоляция речи, музыки и шумов из аудио и видео по текстовому запросу или клику в кадре

Meta перенесла механику Segment Anything в звуковую среду: SAM Audio умеет изолировать конкретные шумы, голос или партии инструментов из готовой звуковой дорожки либо видеоролика. Система построена на базе Diffusion Transformer в латентном пространстве DAC-VAE и делит исходный микс на два независимых потока — целевой звук и весь оставшийся фон. Вместо ручной чистки спектрограмм и возни с фильтрами модель позволяет просто показать пальцем на то, что нужно вырезать.
Что умеет
- Изолировать источник по клику в кадре. Достаточно указать на объект прямо в окне видео, чтобы забрать издаваемый им звук в отдельную дорожку.
- Разбирать сцену по текстовому запросу. Находит и отделяет шум улицы, собачий лай или определенный инструмент по короткому словесному описанию.
- Ориентироваться по времени. Модель поддерживает временные метки (span prompts), когда пользователь задает точку или диапазон на таймлайне с искомым звуком.
- Фильтровать человеческую речь. Отсекает плотный фоновый шум от голоса и разделяет реплики нескольких спикеров.
- Делить треки на стемы. С высокой точностью вычленяет вокальные партии и отдельные музыкальные инструменты из готового трека.
Цены и доступ
Разработка относится к категории исследовательских открытых проектов Meta. В открытый доступ выложены архитектура Perception Encoder Audio Video (PE-AV), открытый датасет для оценки качества аудиосепарации и модель-судья, откалиброванная под человеческое восприятие.
Саунд-дизайнерам, монтажерам и создателям подкастов инструмент обещает избавление от рутинной очистки шумных полевых записей. Убрать посторонний грохот со съемочной площадки или вытащить голос спикера из гула толпы теперь можно буквально парой кликов по видеоряду.


