Новость

Нейросеть Ming Image 0.1 Design печатает читаемый текст на графике прямо по запросу

The image presents a collage of twelve distinct photographs, each capturing a unique moment or scene. The collage is arranged in a grid format with four rows and three columns, creating a harmonious balance of colors and shapes. The photos are arranged in a way that suggests a narrative or story, with each image tellin
Фото: Hugging Face

Знакомая сцена из любого дизайн-отдела: генератор выдает сочную, выверенную по композиции плакатно-шрифтовую сетку, в центре которой красуется абсолютно нечитаемая каша из псевдолатиницы. Дальше начинается рутина — затирание артефактов штампом в растровом редакторе, ручной подбор антиквы и мучительная подгонка кернинга под сгенерированный шум. Команда inclusionAI 22 сентября 2026 года выкатила инструмент, который бьет ровно в эту боль. Их свежая модель Ming Image 0.1 Design создавалась с прицелом на графический дизайн и аккуратную типографику, где буквы остаются буквами, а фразы складываются в связные заголовки без визуальной чепухи.

Нас подкупила прямота разработчиков: они не стали маскировать модель под универсальный комбайн для всего на свете. Архитектура заточена под чистый графический дизайн и верстку, но с порога встречает креатора весьма жесткими рамками. Скормить ей референсный мудборд или набросок от руки не выйдет — система принципиально принимает исключительно текстовые подсказки. Либо вы формулируете задачу словами, либо остаетесь ни с чем.

Характер и форматы

Вторая неожиданность, с которой столкнется арт-директор при интеграции инструмента в пайплайн, касается пропорций. Модель наотрез отказывается подчиняться жестким техническим требованиям артборда. Если попытаться принудительно задать точные пиксельные размеры или конкретное соотношение сторон в промте, сервис не станет масштабировать или кадрировать результат на лету. Он просто отклонит запрос. Размеры и пропорции холста Ming Image 0.1 Design определяет самостоятельно, опираясь на собственную логику композиции. На выходе можно забрать чистый файл в одном из трех привычных форматов на выбор: PNG, JPEG или WebP.

Инфраструктура, задержки и доступ

The image depicts a wooden storefront named "Open Roter" at night. The store's name is illuminated in neon orange letters on the front of the building. The storefront features large windows that display an array of books and decorative items, including potted plants and vases. A black bicycle is parked in front of the
Фото: Hugging Face

Модель выложили в открытый доступ на платформе Hugging Face, а для рабочих пайплайнов и быстрой интеграции подключили API через сервис OpenRouter. Точка входа стандартная — эндпоинт POST https://openrouter.ai/api/v1/images с указанием идентификатора inclusionai/ming-image-0.1-design. Ответ отдается либо через потоковую передачу Server-Sent Events (SSE), либо прямой строкой base64. Хостинг на запуске обеспечивает провайдер NovitaAI, причем на старте плата за генерацию не взимается вовсе — ценник в каталоге выставлен на нулевую отметку.

The image presents a leaderboard for text-to-image (UI/UX) design, showcasing the top 10 projects with their respective Elo scores. The leaderboard is organized in descending order of Elo score, with the top 10 projects displayed in a light blue color. The projects are labeled with their names and Elo scores, and are a
Фото: Hugging Face

Правда, за бесплатный доступ приходится платить временем. Быстрых пятисекундных превью здесь нет — система думает основательно, что вполне ожидаемо для аккуратной работы со шрифтовыми формами.

Параметр задержки (E2E Latency)Время ожидания
Медианное время (P50)35.21 с
75-й процентиль (P75)60.46 с
90-й процентиль (P90)73.63 с
95-й процентиль (P95)85.67 с
99-й процентиль (P99)104.70 с

В худших сценариях генерации переваливают за полторы минуты. При этом инфраструктурная стабильность держится на приличном уровне: аптайм за последние трое суток зафиксирован на отметке 100.00%, а доля успешно обработанных входящих запросов составляет 99.76%.

Разборка на слои

Вместе с основным генератором inclusionAI анонсировали парную модель, которая на практике может оказаться даже полезнее первой — Ming Image 0.1 Design Layer. Она решает прямо противоположную задачу, превращая плоский растровый макет в пригодный для анимации и доработки исходник. Модель принимает ровно одно исходное изображение и текстовый план декомпозиции, после чего аккуратно расщепляет картинку на независимые прозрачные слои в формате RGBA. На выходе получается набор файлов: отдельно фоновая подложка, отдельно вырезанные графические элементы переднего плана, готовые к пересборке или оживлению в моушн-пакетах.

The image presents a collage of three distinct elements. On the left, a gray Volkswagen Golf car is shown, with its front end facing the viewer. In the center, a white and brown cat with piercing green eyes is captured in a close-up shot. On the right, a man dressed in a white jacket and black pants is holding a snowbo
Фото: Hugging Face

Пока связка выглядит как попытка переосмыслить рутинную сборку баннеров и афиш. Отсутствие контроля над точным разрешением и запрет на референсы поначалу сбивают с толку и раздражают, если вы привыкли верстать под строгий формат соцсетей или экранов. Но если Ming Image 0.1 Design избавит дизайнеров от необходимости перерисовывать буквы за нейросетью руками, мы с радостью отдадим ей право самой решать, какой высоты должен быть плакат.

Ещё новости

Все новости