Новость

BytePlus выпустила Dreamina Seedance 2.5 для тридцатисекундных сцен с живым звуком

The image depicts a person standing in a vast, swirling blue and pink nebula-like field. The person's face is partially obscured by their hair, and they are wearing a long, flowing garment that appears to be a robe or dress. The image is rendered in a surreal, dreamlike style, with the colors and shapes creating a sens
Фото: BytePlus

Знакомый кошмар генеративного продакшена: на третьей секунде у героя плывет линия челюсти, на пятой меняется фактура пиджака, а на седьмой ракурс камеры без спроса улетает в неконтролируемый крен. Креаторам приходится сшивать двухсекундные куски, маскировать стыки и отдельно собирать интершумы. BytePlus выкатила мультимодальную модель Dreamina Seedance 2.5, которая бьет ровно по этой рутине. Система берется за один проход отдавать сцены длиной до 30 секунд — с единой оптикой, внятным развитием сюжета и готовой аудиодорожкой.

Разработчики ориентировали новинку на рекламные ролики, продуктовые презентации и персонажные истории. Минимальный порог генерации составляет 4 секунды, потолок — полминуты непрерывного кадра. Нас подкупило, как в архитектуре решена проблема консистентности: внутрь разрешено скормить внушительный массив вводных данных. Модель принимает одновременно до 50 мультимодальных референсов — и это не просто статичные картинки с лицом персонажа, а смесь из графики, видеофрагментов и звуковых дорожек. За счет такой пачки исходников система держит внешность героев, фирменные элементы бренда, общую композицию сцены и сложную траекторию движения виртуальной камеры.

The image depicts a person standing in a field, with their arms outstretched, against a backdrop of a starry night sky. The sky is a deep blue, with streaks of white light that appear to be stars. The person is wearing a light-colored shirt and pants. The image is taken from a low angle, making the person appear larger
Фото: BytePlus

Вместе с картинкой сразу формируется звук. Инженеры заявляют синхронизацию аудио и видеоряда с миллисекундной точностью. В едином пайплайне генерируются фоновые шумы, пространственные эффекты и человеческая речь — если верить демо, подгонять артикуляцию губ и шелест шагов на таймлайне вручную больше не придется.

The image shows a close-up view of a person's face, focusing on their eyes and nose. The person has light blue eyes and a light to medium skin tone. Their lips are a shade of red or burgundy. The background is a soft, out-of-focus blend of blue and pink hues. The person's gaze is directed straight at the camera, creati
Фото: BytePlus

Инструменты точечного контроля и параметры рендера

Для коммерческого продакшена критична возможность вносить правки без полной переделки удачного дубля. В Seedance 2.5 встроили блок Precision Editing — функции инпейнтинга и стилизации, которые позволяют точечно пересобирать готовый материал. Инструмент умеет:

  • Менять конкретные объекты и реквизит в кадре без пересчета базовой геометрии.
  • Подменять лица и корректировать персонажей с сохранением их мимики.
  • Перенастраивать схему освещения сцены и заменять задние планы.
  • Накладывать стилизацию, не разрушая оригинальное кадрирование и траекторию камеры.

На выходе модель выдает видеоряд в разрешении 480P или 720P. Пользователям доступны вариативные соотношения сторон под разные площадки, переключение стилей движения и гибкие настройки финального рендеринга.

Доступ через ModelArk и тарифные пакеты

Модель развернули на облачной платформе ModelArk. Инфраструктура рассчитана на разработчиков и корпоративных клиентов, которым нужны высоконагруженные API-интеграции. Доступ организован по токенной системе, причем купленные пакеты действуют ровно 3 месяца с момента оплаты. В тарификацию заложены повышающие коэффициенты до ~1:1.8 — итоговое списание зависит от выбранного разрешения и сложности входных модальностей.

СтоимостьОбъем токеновПримерный объем видео (в разрешении 480P)
$32.005 млн токенов120–500 секунд
$64.0010 млн токенов250–1000 секунд
$640.00100 млн токенов2500–10000 секунд

В пересчете на реальное время минимальный тариф за 32 доллара дает от двух до восьми минут чистого хронометража в базовом качестве — вполне достаточно, чтобы проверить гипотезы для серии креативов или собрать черновой аниматик перед съемкой.

Главный сдвиг здесь — в переходе от слепого перебора удачных кадров к управляемому режиссерскому процессу. Когда инструмент позволяет загрузить брендбук, раскадровку и референс движения камеры через полсотни файлов, а затем аккуратно перекрасить свет без сбоя геометрии, нейросеть перестает быть генератором случайных картинок. Мы бы попробовали отдать Seedance 2.5 тестовый бриф на рекламу с жесткими требованиями к айдентике: если система действительно удержит форму флакона и пластику актера на тридцати секундах, видеопроизводство сократит часы нудной черновой сборки.

Технология наконец-то начинает говорить на языке монтажного стола, а не случайных текстовых подсказок

Ещё новости

Все новости