HeyGen отказывается от говорящих голов и запускает кинематографическую видеомодель

Привычный образ HeyGen — это говорящая цифровая голова в строгом пиджаке, аккуратно зачитывающая корпоративный тренинг. Компания годами удерживала нишу дикторов по вызову и синхронного дубляжа, но этот коридор явно стал ей тесен. Разработчики выкатили HeyGen Video — свою первую универсальную модель для полноценного видеопроизводства без привязки к лицам и виртуальным аватарам. Вместо говорящего портрета здесь собирают полноценные кинематографические сцены с нуля.
Главная неожиданность релиза кроется даже не в отказе от аватаров, а в слепых тестах. В бенчмарке по методологии Artificial Analysis Arena на массиве из 4800 пользовательских голосований новая модель заняла первую строчку по визуальному качеству. В соревновании за кадром остались такие системы, как Seedance 2.5, Seedance 2.0, H3 Max и Kling 3.0. Пожалуй, это редкий случай, когда сервисный инструмент для маркетологов с первой попытки обходит специализированные генеративные нейросети, созданные исключительно под художественный визуал.
Три сценария генерации
Разработчики разделили работу с видео на три понятных продакшен-режима, закрывающих рутинные задачи студий:
- Text to Video (T2V): сборка кадра по текстовому запросу, где система одновременно генерирует синхронный звук. За один вызов API модель собирает черновой монтаж сразу с диалогами, шумовым оформлением и фоновыми звуковыми эффектами, избавляя от необходимости вручную накладывать дорожки в монтажке.
- Image to Video (I2V): превращение статичной картинки в живое видео. Режим заточен под рендеры недвижимости, предметную съёмку и lifestyle-ролики, где нужно оживить утверждённый макет без пересборки сцены.
- Reference to Video (Ref2V): перенос динамики, композиции и стилистики из готового видеореференса в сгенерированный материал. При этом исходные картинки и аудиофайлы для наведения стиля можно скармливать модели бесплатно — тарифицируется только хронометраж.
Цены на секунды и сравнение с конкурентами
Запуск сопроводили агрессивной ценовой политикой. Пока веб-интерфейс только верстается, модель работает исключительно через API. До конца октября действует скидка 50%, которая опускает планку входа до одного цента за секунду в разрешении 480p.
| Режим генерации | Разрешение | Промо-тариф до конца октября | Стандартный тариф с ноября |
|---|---|---|---|
| Text to Video | 480p | $0,01 за сек | $0,02 за сек |
| Text to Video | 768p | $0,015 за сек | $0,03 за сек |
| Image to Video | 480p | $0,01 за сек | $0,02 за сек |
| Image to Video | 768p | $0,015 за сек | $0,03 за сек |
| Reference to Video | 480p | $0,02 за сек | $0,04 за сек |
| Reference to Video | 768p | $0,03 за сек | $0,06 за сек |
В расчётах тарифа Ref2V есть важная деталь: итоговая сумма складывается из хронометража загруженного видео и длительности сгенерированного ролика. Но даже с учётом двойного подсчёта ценник остаётся вызывающе низким на фоне индустрии.
Если взглянуть на стоимость секунды в разрешении 768p без учёта скидок, разрыв с ближайшими аналогами становится показательным:
| Модель | Базовая цена за секунду (768p) |
|---|---|
| HeyGen Video | $0,03 |
| H3 Max Turbo | $0,04 |
| H3 Max | $0,08 |
| Kling 3.0 Pro | $0,168 |
| Seedance 2.0 | $0,303 |
| Veo 3.1 | $0,40 |
Нас подкупило то, как разработчики подошли к режиму T2V: генерация шумов и голоса внутри единого запроса к API снимает огромный пласт технической рутины. Если верить демо, арт-директорам и моушн-дизайнерам теперь проще проверять раскадровки на клиентах — черновой синематик со звуком собирается за секунды и стоит карманных денег. Пока генерация живёт только в консоли разработчиков, но как только функционал зашьют в привычный интерфейс платформы, расклад сил в агентском пайплайне заметно сдвинется.
Корпоративные лекторы ушли на второй план: теперь компания продаёт дешёвый кинематографический рендер оптом.


