Китайский ИИ-стартап MiniMax выпустил мультимодальную модель генерации видео Hailuo H3, способную одновременно обрабатывать текст, визуальные входные данные и аудио. Согласно информации Reuters, этот релиз напрямую обостряет конкуренцию на быстрорастущем рынке видеогенерации, где ранее доминировали решения от технологических гигантов ByteDance и Kuaishou.
Архитектура системы представляет собой не просто минорное обновление предыдущей версии Hailuo 2.3, а попытку объединить алгоритмы генерации, виртуальной режиссуры и звукового сопровождения в едином вычислительном контуре. Модель поддерживает базовые форматы text-to-video и image-to-video, при этом разработчики добавили возможность создания последовательности из нескольких сцен с сохранением общей логики повествования.
Ключевым фактором на фоне конкурентов становится экономическая и дистрибуционная стратегия проекта, поскольку заявленная стоимость использования API в три раза ниже существующих закрытых аналогов. При этом команда MiniMax анонсировала планы по переводу H3 в статус open-source, в результате чего публикация открытых весов может существенно изменить техническую расстановку сил в сегменте коммерческой видеогенерации.
Поделиться:
Релиз DeepSeek-V4-Flash-0731: агентские функции, спекулятивное декодирование и результаты в бенчмарках
DeepSeek-V4-Flash вышел в бету: улучшенные агенты и нативная поддержка Codex