Seedance 2.0
Мультимодальная генерация кинематографичного видео со звуком по текстовым, графическим и аудиореференсам
Команда ByteDance Seed собрала архитектуру совместной генерации видеоряда и звуковой дорожки, превращая разрозненные референсы в единый кадр. Модель Seedance 2.0 ориентирована на креаторов и визуальный продакшен: вместо раздельного рендера картинки и последующего поиска саунд-дизайна система просчитывает аудио и визуал синхронно, опираясь на заданные входные данные любого формата.
Что умеет
- Синхронно генерировать изображение и звук в рамках единой мультимодальной модели.
- Принимать на вход текст, статичные изображения, аудиофайлы и видеоролики в качестве ориентиров для сцены.
- Управлять ключевыми съёмочными параметрами: поведением персонажей в кадре, постановкой света, теневым рисунком и траекторией движения камеры.
- Сохранять стабильность движения объектов без артефактов и скачков между кадрами.
- Работать в режимах генерации текста в видео (Text-to-Video), анимации картинок (Image-to-Video) и сложных мультимодальных сценариях.
Цены и доступ
Модель развёрнута для тестирования через интерактивную среду BytePlus Playground и чат Dola, а для интеграции в сторонние пайплайны предусмотрен программный доступ через API. Тарифные планы и точные расценки на странице модели не раскрываются.
Инструмент пригодится арт-директорам, режиссёрам и моушн-дизайнерам, которым нужен плотный контроль над композицией, светом и поведением камеры при сборке превизов и кинематографичных шотов.
