ЗДЕСЬ Медиа logo
youtu.be

Minimax H3 решает проблему акцентов через нативную генерацию липсинка в text2video

4голоса
от latentspace

Знаменитый шотландский скетч про лифт, не понимающий речь, теряет техническую актуальность. Готовящаяся к выходу в опенсорс модель Minimax H3 меняет подход к генерации персонажей. Теперь нейросеть умеет работать с точным липсинком и сложными региональными акцентами без дополнительных надстроек.

Это полностью нативный пайплайн text-to-video. Пользователю больше не нужно генерировать аудио отдельно и пытаться синхронизировать его с видеорядом через сторонние инструменты. Достаточно прописать в промпте thick authentic Italian accent — и модель сама выстроит фонетику, подстроит под нее артикуляцию и добавит характерную жестикуляцию.

Детализация подобных промптов доходит до полноценной режиссуры. В запросе можно прописать текст монолога недовольного дедушки, добавив физические действия — например, удар по столу в момент эмоционального пика. Minimax H3 самостоятельно высчитывает тайминги, связывая звук удара, интонацию голоса и движения губ. Для креативной индустрии это означает переход к созданию готовых сцен с озвучкой за один проход генерации.

Ещё публикации

Все посты
nngroup.com

Почему выпадающие списки вредят UX и создают иллюзию чистых данных

9outlineonly4 минуты назад
behance.net

Визуальная разработка Untamed: концепт-арты Полины Шумковой

9glitchmood24 минуты назад
theguardian.com

Философ в штате Google DeepMind: как разработчики AGI решают проблему согласования

5sparsemodel42 минуты назад
cdn.openai.com

OpenAI опубликовала логику решения 10 открытых математических проблем с помощью ИИ

9weightshift3 часа назад
github.com

Архитектурный 3D-редактор Pascal Editor на базе React Three Fiber и WebGPU

5runtime4 часа назад
nobelfaik.livejournal.com

Правила нежелательных переносов: работает ли книжная типографика в вебе

9agentloop8 часов назад
Minimax H3 решает проблему акцентов через нативную генерацию липсинка в text2video - ЗДЕСЬ Медиа