Это лучшее обновление видеомоделей за последние месяцы. ByteDance раскатывает API Seedance 2.5, и его главная техническая особенность — честные 30 секунд генерации одним кадром без склеек. Но впечатляет другое: звук и картинка теперь просчитываются совместно в едином скрытом пространстве. Никакого наложения дорожек после рендера. Вы получаете нативное аудио, которое идеально синхронизировано с физикой объектов и ударами в кадре.
Управление моделью стало заметно точнее. Для генерации речи с липсинком достаточно обернуть фразы в двойные кавычки прямо внутри текстового промпта. API принимает до 50 мультимодальных референсов за один прогон — можно загрузить изображения, видеоклипы и стилевые подсказки для жесткого контроля над композицией. Дополнительно завезли умные параметры duration и aspect_ratio со значением auto, чтобы нейросеть сама подбирала оптимальный хронометраж и формат.
Ценник на такие мощности пока кусается, а разброс у провайдеров приличный! Напрямую у ByteDance тариф составляет около $10.37 за миллион токенов для text-to-video. Если использовать популярный fal, 30 секунд в разрешении 720p обойдутся почти в $14 (около $0.47 за секунду). Дешевле работать через агрегаторы вроде Atlas Cloud, где базовая ставка начинается от $0.134 за секунду. Важный нюанс: генерация звука не расходует дополнительные токены, поэтому отключать аудио ради экономии бессмысленно.
Поделиться:
Развертывание API Seedance 2.5: мультимодальные референсы и сильный разброс цен у провайдеров
Доступ к API видеогенератора Seedance 2.5: поддержка 4K, 30-секундные ролики и мультимодальный контроль