РазноебесплатноMeta

Meta Segment Anything Model Audio (SAM Audio)

Изоляция речи, музыки и шумов из аудио и видео по текстовому запросу или клику в кадре

Фото: Meta AI

Meta перенесла механику Segment Anything в звуковую среду: SAM Audio умеет изолировать конкретные шумы, голос или партии инструментов из готовой звуковой дорожки либо видеоролика. Система построена на базе Diffusion Transformer в латентном пространстве DAC-VAE и делит исходный микс на два независимых потока — целевой звук и весь оставшийся фон. Вместо ручной чистки спектрограмм и возни с фильтрами модель позволяет просто показать пальцем на то, что нужно вырезать.

Что умеет

  • Изолировать источник по клику в кадре. Достаточно указать на объект прямо в окне видео, чтобы забрать издаваемый им звук в отдельную дорожку.
  • Разбирать сцену по текстовому запросу. Находит и отделяет шум улицы, собачий лай или определенный инструмент по короткому словесному описанию.
  • Ориентироваться по времени. Модель поддерживает временные метки (span prompts), когда пользователь задает точку или диапазон на таймлайне с искомым звуком.
  • Фильтровать человеческую речь. Отсекает плотный фоновый шум от голоса и разделяет реплики нескольких спикеров.
  • Делить треки на стемы. С высокой точностью вычленяет вокальные партии и отдельные музыкальные инструменты из готового трека.

Цены и доступ

Разработка относится к категории исследовательских открытых проектов Meta. В открытый доступ выложены архитектура Perception Encoder Audio Video (PE-AV), открытый датасет для оценки качества аудиосепарации и модель-судья, откалиброванная под человеческое восприятие.

Саунд-дизайнерам, монтажерам и создателям подкастов инструмент обещает избавление от рутинной очистки шумных полевых записей. Убрать посторонний грохот со съемочной площадки или вытащить голос спикера из гула толпы теперь можно буквально парой кликов по видеоряду.

Сайт Meta Segment Anything Model Audio (SAM Audio)
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд