BytePlus выпустила Dreamina Seedance 2.5 для тридцатисекундных сцен с живым звуком

Знакомый кошмар генеративного продакшена: на третьей секунде у героя плывет линия челюсти, на пятой меняется фактура пиджака, а на седьмой ракурс камеры без спроса улетает в неконтролируемый крен. Креаторам приходится сшивать двухсекундные куски, маскировать стыки и отдельно собирать интершумы. BytePlus выкатила мультимодальную модель Dreamina Seedance 2.5, которая бьет ровно по этой рутине. Система берется за один проход отдавать сцены длиной до 30 секунд — с единой оптикой, внятным развитием сюжета и готовой аудиодорожкой.
Разработчики ориентировали новинку на рекламные ролики, продуктовые презентации и персонажные истории. Минимальный порог генерации составляет 4 секунды, потолок — полминуты непрерывного кадра. Нас подкупило, как в архитектуре решена проблема консистентности: внутрь разрешено скормить внушительный массив вводных данных. Модель принимает одновременно до 50 мультимодальных референсов — и это не просто статичные картинки с лицом персонажа, а смесь из графики, видеофрагментов и звуковых дорожек. За счет такой пачки исходников система держит внешность героев, фирменные элементы бренда, общую композицию сцены и сложную траекторию движения виртуальной камеры.

Вместе с картинкой сразу формируется звук. Инженеры заявляют синхронизацию аудио и видеоряда с миллисекундной точностью. В едином пайплайне генерируются фоновые шумы, пространственные эффекты и человеческая речь — если верить демо, подгонять артикуляцию губ и шелест шагов на таймлайне вручную больше не придется.

Инструменты точечного контроля и параметры рендера
Для коммерческого продакшена критична возможность вносить правки без полной переделки удачного дубля. В Seedance 2.5 встроили блок Precision Editing — функции инпейнтинга и стилизации, которые позволяют точечно пересобирать готовый материал. Инструмент умеет:
- Менять конкретные объекты и реквизит в кадре без пересчета базовой геометрии.
- Подменять лица и корректировать персонажей с сохранением их мимики.
- Перенастраивать схему освещения сцены и заменять задние планы.
- Накладывать стилизацию, не разрушая оригинальное кадрирование и траекторию камеры.
На выходе модель выдает видеоряд в разрешении 480P или 720P. Пользователям доступны вариативные соотношения сторон под разные площадки, переключение стилей движения и гибкие настройки финального рендеринга.
Доступ через ModelArk и тарифные пакеты
Модель развернули на облачной платформе ModelArk. Инфраструктура рассчитана на разработчиков и корпоративных клиентов, которым нужны высоконагруженные API-интеграции. Доступ организован по токенной системе, причем купленные пакеты действуют ровно 3 месяца с момента оплаты. В тарификацию заложены повышающие коэффициенты до ~1:1.8 — итоговое списание зависит от выбранного разрешения и сложности входных модальностей.
| Стоимость | Объем токенов | Примерный объем видео (в разрешении 480P) |
|---|---|---|
| $32.00 | 5 млн токенов | 120–500 секунд |
| $64.00 | 10 млн токенов | 250–1000 секунд |
| $640.00 | 100 млн токенов | 2500–10000 секунд |
В пересчете на реальное время минимальный тариф за 32 доллара дает от двух до восьми минут чистого хронометража в базовом качестве — вполне достаточно, чтобы проверить гипотезы для серии креативов или собрать черновой аниматик перед съемкой.
Главный сдвиг здесь — в переходе от слепого перебора удачных кадров к управляемому режиссерскому процессу. Когда инструмент позволяет загрузить брендбук, раскадровку и референс движения камеры через полсотни файлов, а затем аккуратно перекрасить свет без сбоя геометрии, нейросеть перестает быть генератором случайных картинок. Мы бы попробовали отдать Seedance 2.5 тестовый бриф на рекламу с жесткими требованиями к айдентике: если система действительно удержит форму флакона и пластику актера на тридцати секундах, видеопроизводство сократит часы нудной черновой сборки.
Технология наконец-то начинает говорить на языке монтажного стола, а не случайных текстовых подсказок


