Stem Studio: локальное разделение звука на диалоги, музыку и шумы

Опенсорсная утилита Stem Studio разделяет сведенный аудиоканал на три независимых трека: диалоги, музыку и звуковые эффекты. Это решает проблему исходников, в которых черновой звук слили в одну дорожку. Инструмент работает локально и не требует загрузки данных на сторонние серверы.
На выходе движок отдает три WAV файла формата 48 кГц и 24 бита. Математика разделения работает строго без потерь. При сложении готовых треков получается исходный микс с точностью до семпла. Если на вход идет видеофайл, программа автоматически собирает новый .mov контейнер. В нем оригинальная картинка сразу объединяется с разделенными и подписанными аудиодорожками для импорта в монтажную программу.
Для запуска нужна macOS на Apple Silicon или Linux с видеокартой и CUDA. Под капотом работает независимый Python-воркер на базе PyTorch, а для обработки медиа требуется установленный ffmpeg. В настройках доступны три режима качества вычислений и отдельная опция полировки голоса. Она вырезает остатки музыки из речи и переносит этот спектр в дорожку эффектов для сохранения идеального сведения исходного микса.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад