Seed Audio 1.0
Генерация цельных звуковых сцен с речью, шумами и эмбиенсом по текстовому описанию
Звукорежиссеры и моушн-дизайнеры привыкли собирать аудиоряд по слоям: дикторская начитка отдельно, фоновый гул комнаты на вторую дорожку, шаги и хлопки дверей — на третью. Seed Audio 1.0 предлагает иной подход и генерирует сцену целиком по одному текстовому описанию. Архитектура объединяет языковую модель и диффузионный акустический синтезатор, связывая актерскую подачу, шумы и акустику помещения в цельное аудиополотно.
Что умеет
- Сборка сцены из одного запроса: создает согласованную звуковую дорожку, где реплики, эффекты и интершумы изначально сведены по тону, динамике и акустическому пространству.
- Контроль тайминга с шагом 100 мс: автор может точно указывать моменты вступления реплик персонажей, подгоняя аудио под монтажные склейки или готовый видеоряд.
- Управление характером голоса: тембр задается текстом, авторизованным сэмплом или их комбинацией без отдельного обучения нейросети. Персонаж сохраняет узнаваемость при скачках от спокойного повествования к драме.
- Длинные дорожки: синтезирует до двух минут звука за один проход и поддерживает дальнейшее продолжение файла без потери контекста.
- Работа на 20+ языках: поддерживает английский, испанский, французский, немецкий, китайский, японский и другие языки, сохраняя тембральный профиль персонажа при локализации.
Цены и доступ
Инструмент запущен через платформу BytePlus. Конкретные тарифные сетки и условия использования API на странице проекта не раскрываются.
Модель пригодится создателям коротких видео, аниматорам и рекламным студиям: с ней можно быстро озвучить аниматик, собрать черновой саунд-дизайн для клиента или адаптировать ролик под зарубежные рынки без ручной укладки дорожек на таймлайне.
