Утечка данных Suno подтвердила парсинг миллионов треков с YouTube Music, Deezer и Genius

Хакер под псевдонимом ellie.191 опубликовал исходный код и внутренние скрипты музыкальной нейросети Suno за 2023–2024 годы. Утечка подтвердила, что для обучения генеративной модели разработчики массово собирали контент с крупнейших аудиоплатформ, включая YouTube Music, Deezer и базу текстов Genius. В слитых логах также фигурируют стоки Pond5, Jamendo, Freesound и архив музыкальных партитур IMSLP.
Анализ утекших скриптов показывает масштаб автоматизированного сбора данных для тренировки нейросети. Только с серверов YouTube Music алгоритмы выкачали более 2 миллионов клипов и аудиодорожек. При этом особое внимание скриптов уделялось извлечению изолированных вокальных партий. Разработчики целенаправленно искали и сохраняли акапеллы, что позволяло модели тренироваться на чистом человеческом голосе без инструментальных примесей, напрямую влияя на качество синтеза вокала в итоговом продукте.
Раскрытие конкретных методов формирования датасета происходит на фоне активных судебных разбирательств между создателями ИИ-моделей и крупными звукозаписывающими лейблами. Документальное подтверждение несанкционированного парсинга коммерческих стриминговых сервисов лишает стартап возможности ссылаться на использование исключительно открытых или лицензированных данных, что в результате формирует прямую доказательную базу для правообладателей в вопросах нарушения копирайта.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад