Команда Kandinsky Lab выпустила KVAE-Audio — открытый автоэнкодер, сжимающий звук в 960 раз для обучения генеративных моделей

Команда Kandinsky Lab опубликовала алгоритм KVAE-Audio с открытым исходным кодом. Это полнодиапазонный непрерывный автоэнкодер, который обрабатывает звук с частотой дискретизации 48 кГц и сжимает исходный сигнал по времени в 960 раз. В результате формируется компактное латентное пространство, ограниченное 64 каналами, что позволяет трансформировать сырые данные в плотное представление, сохраняя высокую точность акустической реконструкции.
Основная задача инструмента сводится к созданию оптимизированного базиса для генеративных моделей. Сжатие аудиоданных в сотни раз снижает вычислительную нагрузку при обучении нейросетей, поскольку им больше не требуется анализировать исходные волновые сигналы напрямую. При этом интеграция KVAE-Audio в пайплайн преобразования текста в звук приводит к росту качества генерации даже при условии использования фиксированной архитектуры базового генератора.
Алгоритм насчитывает 166,9 миллиона параметров, что делает его компактнее многих индустриальных аналогов. Оценка качества восстановления на наборах данных AudioSet и LibriSpeech подтверждает, что модель эффективно балансирует между степенью компрессии и точностью звучания. В ряде объективных метрик решение успешно конкурирует с более ресурсоемкими архитектурами, включая SAME-L на 852 миллиона параметров и MMAudio, при реконструкции речи, музыки и общих шумов.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад