ByteDance открыла доступ к API Seedance 2.5, где ключевым обновлением стал эндпоинт reference-to-video. Модель обрабатывает до 50 мультимодальных референсов одновременно, позволяя комбинировать изображения, видео и аудио для контроля над внешностью, движением и композицией. Генерация происходит единым 30-секундным дублем без скрытых склеек, при этом звук и видеоряд создаются совместно в одном латентном пространстве, что делает аудио полноценным сигналом для тайминга происходящего на экране.
Взаимодействие с API построено на позиционном цитировании. Разработчики передают массивы ссылок на медиафайлы, а в текстовом промпте ссылаются на них через теги формата [Image1] или [Video1]. Этот подход позволяет в одном запросе описать замену объекта, перенос движений или изменение стиля, при этом параметры duration и aspect_ratio могут вычисляться моделью автоматически на основе загруженных исходников. Для интеграции используется клиент @fal-ai/client, поддерживающий асинхронную обработку очередей, поскольку запросы с видеореференсами требуют наибольшего времени вычислений.
Стоимость использования модели напрямую зависит от выбранного провайдера. На платформе fal тарификация базируется на токенах: секунда видео в 720p обойдется примерно в $0.473, что составляет около $14.19 за 30-секундный ролик. При загрузке видеореференсов применяется понижающий коэффициент 0.6, однако биллинг учитывает длительность как выходного, так и исходного видео. При этом базовая тарификация самой ByteDance составляет около $10.37 за миллион токенов, а альтернативные агрегаторы вроде Atlas Cloud предлагают ставки от $0.134 за секунду. Подобный разброс цен делает выбор инфраструктуры определяющим фактором при масштабировании генеративных видеопродуктов.
Поделиться:
Разработчики открытой видеомодели MiniMax-H3 анонсировали релиз 2K-апскейлера и Sparse Attention
OpenAI запустила автоматическую проверку безопасности pull request'ов в GitHub через Codex