Принято считать, что нейросети для генерации музыки годятся лишь на создание пластиковых поп-хитов с обезличенным вокалом. Реальность оказывается интереснее, когда в алгоритм попадает нетипичный аудиоматериал. Недавно опубликованный трек проекта DUGAI показывает, как работает связка из нескольких доступных инструментов. Автор решил проверить способность Suno копировать идентичность живого голоса, использовав платформу для создания полноценного клона.
Процесс подготовки исходников далек от студийных стандартов. Для создания слепка голоса автор накричал текст в микрофон смартфона, пропустил аудио через Adobe Podcast для базовой очистки и загрузил результат как вокальный референс. С написанием текста помогал Claude, который стилизовал лирику под нужный формат. В результате получился довольно грязный рэп, который нейросеть самостоятельно собрала из обработанной голосовой заметки и текстового промпта.
Правда, за этой механикой скрывается полная потеря предсказуемости результата. Алгоритм действительно захватывает базовый тембр, но заставить его выдать конкретную эмоцию или правильную интонацию в нужном такте всё ещё крайне сложно. Вопрос в том, имеет ли смысл такой синтез для серьезного продакшена? Пока что это отличный инструмент для черновых демок и локальных экспериментов, но собрать из этого полностью контролируемый коммерческий продукт без глубокого ручного тюнинга пока не выйдет.
Поделиться:
OpenAI снизила цену GPT-5.6 Luna на 80% после автономной оптимизации серверов самой нейросетью
Инди-студия Torchlight Games ищет 2D-художника для создания Steam-обложки соулслайка False Hero