Новость

HeyGen отказывается от говорящих голов и запускает кинематографическую видеомодель

Иллюстрация: редакция ЗДЕСЬ

Привычный образ HeyGen — это говорящая цифровая голова в строгом пиджаке, аккуратно зачитывающая корпоративный тренинг. Компания годами удерживала нишу дикторов по вызову и синхронного дубляжа, но этот коридор явно стал ей тесен. Разработчики выкатили HeyGen Video — свою первую универсальную модель для полноценного видеопроизводства без привязки к лицам и виртуальным аватарам. Вместо говорящего портрета здесь собирают полноценные кинематографические сцены с нуля.

Главная неожиданность релиза кроется даже не в отказе от аватаров, а в слепых тестах. В бенчмарке по методологии Artificial Analysis Arena на массиве из 4800 пользовательских голосований новая модель заняла первую строчку по визуальному качеству. В соревновании за кадром остались такие системы, как Seedance 2.5, Seedance 2.0, H3 Max и Kling 3.0. Пожалуй, это редкий случай, когда сервисный инструмент для маркетологов с первой попытки обходит специализированные генеративные нейросети, созданные исключительно под художественный визуал.

Три сценария генерации

Разработчики разделили работу с видео на три понятных продакшен-режима, закрывающих рутинные задачи студий:

  • Text to Video (T2V): сборка кадра по текстовому запросу, где система одновременно генерирует синхронный звук. За один вызов API модель собирает черновой монтаж сразу с диалогами, шумовым оформлением и фоновыми звуковыми эффектами, избавляя от необходимости вручную накладывать дорожки в монтажке.
  • Image to Video (I2V): превращение статичной картинки в живое видео. Режим заточен под рендеры недвижимости, предметную съёмку и lifestyle-ролики, где нужно оживить утверждённый макет без пересборки сцены.
  • Reference to Video (Ref2V): перенос динамики, композиции и стилистики из готового видеореференса в сгенерированный материал. При этом исходные картинки и аудиофайлы для наведения стиля можно скармливать модели бесплатно — тарифицируется только хронометраж.

Цены на секунды и сравнение с конкурентами

Запуск сопроводили агрессивной ценовой политикой. Пока веб-интерфейс только верстается, модель работает исключительно через API. До конца октября действует скидка 50%, которая опускает планку входа до одного цента за секунду в разрешении 480p.

Режим генерацииРазрешениеПромо-тариф до конца октябряСтандартный тариф с ноября
Text to Video480p$0,01 за сек$0,02 за сек
Text to Video768p$0,015 за сек$0,03 за сек
Image to Video480p$0,01 за сек$0,02 за сек
Image to Video768p$0,015 за сек$0,03 за сек
Reference to Video480p$0,02 за сек$0,04 за сек
Reference to Video768p$0,03 за сек$0,06 за сек

В расчётах тарифа Ref2V есть важная деталь: итоговая сумма складывается из хронометража загруженного видео и длительности сгенерированного ролика. Но даже с учётом двойного подсчёта ценник остаётся вызывающе низким на фоне индустрии.

Если взглянуть на стоимость секунды в разрешении 768p без учёта скидок, разрыв с ближайшими аналогами становится показательным:

МодельБазовая цена за секунду (768p)
HeyGen Video$0,03
H3 Max Turbo$0,04
H3 Max$0,08
Kling 3.0 Pro$0,168
Seedance 2.0$0,303
Veo 3.1$0,40

Нас подкупило то, как разработчики подошли к режиму T2V: генерация шумов и голоса внутри единого запроса к API снимает огромный пласт технической рутины. Если верить демо, арт-директорам и моушн-дизайнерам теперь проще проверять раскадровки на клиентах — черновой синематик со звуком собирается за секунды и стоит карманных денег. Пока генерация живёт только в консоли разработчиков, но как только функционал зашьют в привычный интерфейс платформы, расклад сил в агентском пайплайне заметно сдвинется.

Корпоративные лекторы ушли на второй план: теперь компания продаёт дешёвый кинематографический рендер оптом.

Ещё новости

Все новости →