HunyuanImage-3.0
Мультимодальная MoE-модель с открытыми весами для генерации картинок по тексту и гибкого редактирования кадров
Команда Tencent выкатила в открытый доступ HunyuanImage-3.0 — авторегрессионную мультимодальную модель, в которой разработчики отошли от ставшей стандартом диффузионной архитектуры DiT. Внутри трудится архитектура Mixture of Experts на 80 миллиардов параметров с 64 экспертами, где на каждый токен активируется 13 миллиардов. Система объединяет понимание текста и визуальный синтез в едином контуре, поэтому умеет рассуждать над входящим запросом и опираться на заложенные знания об окружающем мире.
Что умеет
- Генерация по тексту: создаёт детализированные фотореалистичные кадры со строгим следованием смыслу промпта.
- Режим Image-to-Image: выполняет творческое редактирование загруженных картинок и объединяет несколько разных исходников в одну сцену.
- Осмысление и разворачивание промптов: версия HunyuanImage-3.0-Instruct с механизмом рассуждения сама достраивает короткие фразы пользователя до подробных описаний.
- Быстрый сэмплинг: дистиллированная сборка Instruct-Distil выдаёт финальное изображение всего за 8 шагов.
- Оптимизация под железо: поддерживает стек vLLM и библиотеку FlashInfer, которая ускоряет инференс MoE до трёх раз.
Цены и доступ
Веса модели и исходный код открыты и опубликованы на Hugging Face и GitHub. Запустить пайплайн можно локально через библиотеку Transformers или интерактивный веб-интерфейс на Gradio, а протестировать генерацию без развёртывания — на платформе Tencent. Для локальной сборки разработчики рекомендуют Python 3.12+, CUDA 12.8 и свежий PyTorch.
Модель пригодится техническим дизайнерам, арт-директорам и продакшен-командам со своим серверным парком, которым нужен независимый инструмент для создания визуалов и переработки рендеров внутри закрытого контура.
