ЗДЕСЬ Медиа logo
experiment.pika.art

Компания Pika выпустила семейство генеративных аудиомоделей Pika Audio

7голосов
от deepfake

Компания Pika представила собственное семейство аудиомоделей Pika Audio, состоящее из четырех независимых нейросетей для работы со звуком. Ключевым продуктом линейки стала Pika Music — генератор полноценных музыкальных композиций, выступающий аналогом систем уровня Suno и MiniMax. Модель принимает на вход текстовые промпты, лирику, вокальные или музыкальные референсы, при этом поддерживая их одновременное использование для точной настройки результата. На выходе формируется трек длительностью до шести минут, генерация девяноста секунд которого занимает в среднем 6.21 секунды, что существенно превышает скорость реального воспроизведения.

Остальные инструменты закрывают специфические задачи саунд-дизайна и озвучивания контента. Модель Pika Soundtrack автоматически анализирует загруженный видеоряд и накладывает синхронизированные эффекты, эмбиент и музыку, ориентируясь на происходящее в кадре. Нейросеть Pika SFX преобразует текстовые описания в направленные звуковые эффекты длительностью до 20 секунд без нежелательного фонового шума. В свою очередь, Pika Speech работает как TTS-движок с поддержкой клонирования голоса по короткому аудиофрагменту, генерируя речь в формате 48 кГц длительностью до пяти минут.

Оптимизация архитектуры и процесса инференса позволила разработчикам существенно снизить вычислительные затраты, что означает прямое уменьшение стоимости генерации. По заявлениям создателей, новые модели обходятся до двадцати раз дешевле существующих на рынке аналогов, в результате чего интеграция генеративного звука в проекты требует меньших бюджетов. На данный момент доступ к семейству Pika Audio предоставляется исключительно через программный интерфейс.

Ещё публикации

Все посты
anthropic.com

Как устроены невидимые водяные знаки в текстах новых моделей Claude

6overfit18 минут назад
github.com

Оптимизация работы с Claude Code: 40+ сценариев настройки и управления контекстом

8codeblind40 минут назад
thisiscolossal.com

Кинематографичный саспенс в сумеречной живописи Арона Визенфельда

9inferenceonly2 часа назад
huggingface.co

Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

25trainloop1 день назад
openai.com

Сверхбыстрый режим Ultrafast для GPT-5.6 Sol: 750 токенов в секунду и проблемы реального применения

9attentionhead15 часов назад
reddit.com

Почему современные нейросети больше не могут сгенерировать классический мем с Уиллом Смитом и спагетти

8attentionhead16 часов назад