Tencent представила нейросеть Hy Image 3.5 с единым редактором для предметки

Знакомая сцена из будней коммерческого продакшена: арт-директор просит всего лишь повернуть упаковку в кадре на три четверти и заменить полуденное солнце на рассеянный свет софтбокса. В классических диффузионных пайплайнах эта невинная правка мгновенно превращает этикетку в бессвязную кашу, а фирменный цвет банки уплывает в соседний оттенок. Релиз модели Hy Image 3.5 Preview от Tencent целится ровно в эту болевую точку. Разработчики упаковали генерацию с чистого листа и глубокое многошаговое редактирование в общий рабочий контур, сфокусировавшись на требованиях коммерческой фотографии.
Главный сдвиг здесь лежит в логике взаимодействия со сценой. Система научилась удерживать контекст между последовательными итерациями, избавив креатора от бесконечной лотереи с сидами. Внутри одного интерфейса объединили режимы text-to-image и image-to-image. Скормив модели сразу несколько справочных изображений, можно поэтапно переодевать персонажей, менять световые схемы и выставлять новые ракурсы камеры. При этом нейросеть помнит геометрию сцены и бережно сохраняет форму продукта, упаковку и читаемость этикеток при радикальной смене окружения.

По заверениям разработчиков, версию 3.5 основательно доработали под задачи визуальной рекламы и графического дизайна. Список ключевых улучшений закрывает типичные претензии студий к генеративному арту:
- Рендеринг текста и типографика;
- Построение композиции и верстка элементов в кадре;
- Коммерческая предметная фотография;
- Физическая достоверность материалов и световых сценариев;
- Визуальная консистентность объектов: удержание формы товара, цвета и надписей при любых манипуляциях со сценой.
Экономика генерации и скрытые лимиты
Тарифная сетка оказалась подчеркнуто практичной. Базовая стоимость генерации одного изображения в разрешении 2K через Tencent Cloud API составляет ровно 0,024 доллара. Приятная деталь для сложных многослойных проектов: загрузка и использование референсов отдельно не тарифицируются, оплачивается исключительно готовый результат на выходе.
В официальном анонсе создатели осторожно заявляют планку качества «до 2K». Однако в технической документации API обнаруживается любопытная деталь: система способна принимать запросы с разрешением вплоть до 4096×4096 пикселей. Фиксированный прайс в 0,024 доллара привязан именно к 2K, поэтому работа с предельными форматами потребует отдельного внимания к смете.
| Сервис или инструмент | Формат подключения | Условия доступа | Локальный запуск |
|---|---|---|---|
| Tencent Cloud API | Напрямую через облачный интерфейс | Фиксированные $0,024 за кадр в 2K, поддержка запросов до 4096×4096 пикселей | Недоступен |
| Miora | Пользовательский веб-интерфейс | Двухнедельная бесплатная промо-кампания после релиза модели | Недоступен |
| OnSolo | Каталог платформы | Тестовый доступ с жесткой привязкой к лимитам и тарифным планам | Недоступен |
| ComfyUI | Партнерские ноды (Partner Node) через API | Нулевой день поддержки (Day-0) по API-ключам | Веса закрыты |
Для любителей собирать собственные локальные цепочки новость несет определенный компромисс. Нодовый редактор ComfyUI объявил о день-нулевой поддержке новинки через API и партнерские ноды, но скачать веса на рабочую станцию не выйдет. Скачивание локальных файлов закрыто.
Здесь прослеживается резкая смена курса по сравнению с предыдущей версией. Прошлая итерация Hy 3.0 выходила с полностью открытым исходным кодом, однако файлы весов были настолько огромными, что с трудом помещались в память большинства пользовательских видеокарт. К тому же в «тройке» не было встроенного инструментария для пошагового редактирования. Теперь пайплайн стал значительно дружелюбнее к сложным задачам, но переехал на внешние сервера.
Сторонние сервисы уже начали делить аудиторию. Платформа Miora интегрировала модель в свой веб-интерфейс и объявила о двухнедельной бесплатной акции для всех желающих протестировать новинку в деле. Площадка OnSolo тоже выкатила тестовый доступ, однако бесплатные попытки там жестко привязали к условиям действующих членств и лимитам тарифных планов.
Для визуального продакшена появление подобных моделей означает постепенный отход от случайных генераций в сторону контролируемого ремесла. Нас подкупило, что фокус инженеров сместился с абстрактной детализации на предметку, свет и шрифты — то есть на вещи, из которых складывается реальная студийная работа. Пожалуй, если возможность удерживать типографику и материалы подтвердится на боевых задачах, бесконечная перерисовка логотипов поверх нейросетевых макетов наконец-то уйдет в прошлое.


