Знаменитый шотландский скетч про лифт, не понимающий речь, теряет техническую актуальность. Готовящаяся к выходу в опенсорс модель Minimax H3 меняет подход к генерации персонажей. Теперь нейросеть умеет работать с точным липсинком и сложными региональными акцентами без дополнительных надстроек.
Это полностью нативный пайплайн text-to-video. Пользователю больше не нужно генерировать аудио отдельно и пытаться синхронизировать его с видеорядом через сторонние инструменты. Достаточно прописать в промпте thick authentic Italian accent — и модель сама выстроит фонетику, подстроит под нее артикуляцию и добавит характерную жестикуляцию.
Детализация подобных промптов доходит до полноценной режиссуры. В запросе можно прописать текст монолога недовольного дедушки, добавив физические действия — например, удар по столу в момент эмоционального пика. Minimax H3 самостоятельно высчитывает тайминги, связывая звук удара, интонацию голоса и движения губ. Для креативной индустрии это означает переход к созданию готовых сцен с озвучкой за один проход генерации.
Поделиться:
Почему выпадающие списки вредят UX и создают иллюзию чистых данных
Визуальная разработка Untamed: концепт-арты Полины Шумковой