Все ждут, что генерация длинных сцен одним дублем закроет потребность в сложных пайплайнах. ByteDance выкатили API для Seedance 2.5 с заявкой на 30-секундные генерации без склеек и нативной мультиязычной озвучкой. Модель переваривает до 50 мультимодальных референсов за раз: можно загрузить пачку изображений, аудио и видео для фиксации персонажа и стиля. Технически это выглядит как серьезный инструмент для контроля консистентности кадра.
Но дьявол кроется в тарификации и провайдерах. Напрямую ByteDance считает по токенам — около $10.37 за миллион на чистом тексте. А вот агрегаторы вроде WaveSpeedAI переводят это в посекундный биллинг с диким разбросом. На платформе fal 30 секунд в 720p обойдутся почти в $14, тогда как Atlas Cloud просит за тот же хронометраж около $4. Вопрос в том, насколько стабильно эти API-обертки держат заявленную скорость и не режут ли вычислительные ресурсы ради маржинальности.
Доступные эндпоинты покрывают стандартный цикл: text-to-video, image-to-video, video-extend и турбо-вариации. Удобно, что режим редактирования автоматически подгоняет хронометраж под исходный файл. Правда, остается открытым вопрос стабильности физики при одновременном скармливании 30 картинок и 10 аудиодорожек в одном запросе. Скорее всего, на сложных сценах придется отбраковывать немало платных генераций, прежде чем алгоритм выдаст шот без артефактов.
Поделиться:
Доступ к API видеогенератора Seedance 2.5: поддержка 4K, 30-секундные ролики и мультимодальный контроль
Редактирование видео через промпты в Gemini Omni Flash