Компания Pika представила собственное семейство аудиомоделей Pika Audio, состоящее из четырех независимых нейросетей для работы со звуком. Ключевым продуктом линейки стала Pika Music — генератор полноценных музыкальных композиций, выступающий аналогом систем уровня Suno и MiniMax. Модель принимает на вход текстовые промпты, лирику, вокальные или музыкальные референсы, при этом поддерживая их одновременное использование для точной настройки результата. На выходе формируется трек длительностью до шести минут, генерация девяноста секунд которого занимает в среднем 6.21 секунды, что существенно превышает скорость реального воспроизведения.
Остальные инструменты закрывают специфические задачи саунд-дизайна и озвучивания контента. Модель Pika Soundtrack автоматически анализирует загруженный видеоряд и накладывает синхронизированные эффекты, эмбиент и музыку, ориентируясь на происходящее в кадре. Нейросеть Pika SFX преобразует текстовые описания в направленные звуковые эффекты длительностью до 20 секунд без нежелательного фонового шума. В свою очередь, Pika Speech работает как TTS-движок с поддержкой клонирования голоса по короткому аудиофрагменту, генерируя речь в формате 48 кГц длительностью до пяти минут.
Оптимизация архитектуры и процесса инференса позволила разработчикам существенно снизить вычислительные затраты, что означает прямое уменьшение стоимости генерации. По заявлениям создателей, новые модели обходятся до двадцати раз дешевле существующих на рынке аналогов, в результате чего интеграция генеративного звука в проекты требует меньших бюджетов. На данный момент доступ к семейству Pika Audio предоставляется исключительно через программный интерфейс.
Поделиться:
Как устроены невидимые водяные знаки в текстах новых моделей Claude
Оптимизация работы с Claude Code: 40+ сценариев настройки и управления контекстом