Новость

OpenAI представила ChatGPT Images 2.5 с точечной правкой кадров и поддержкой скетчей

The image shows a young boy seated on a chair, wearing a cream or off-white tuxedo with a black bow tie and a black pocket square. He is looking directly at the camera with a neutral expression. The background is a solid blue color, and a portion of a dark green object is visible on the left side of the image. The boy'
Фото: OpenAI

Знакомая сцена на рендере: вы просите нейросеть всего лишь сдвинуть чашку на краю стола или поменять цвет кружки, а взамен получаете полностью перерисованную комнату, уплывшую перспективу и внезапно изменившееся лицо героя. OpenAI выкатила ChatGPT Images 2.5 именно ради того, чтобы прекратить эту лотерею правок.

Главный инженерный упор в релизе сделан на две вещи — общее качество отрисовки и хирургическую точность локального редактирования фотографий. Теперь модель умеет изолировать строго определенные участки кадра, не перебирая соседние пиксели и не разрушая исходную композицию.

The image shows a young boy with dark brown skin and short, dark hair, wearing a vibrant red shirt with black accents on the collar and sleeves. He is seated and looking directly at the camera with a neutral expression. The boy is positioned in front of a blue background, which appears to be a photo album or similar it
Фото: OpenAI

Стабильность в несколько подходов

Самое болезненное место диффузионных пайплайнов всегда скрывалось в многошаговой работе. До сих пор любая попытка вести диалог с визуальной моделью дальше второго запроса превращалась в деградацию картинки: с каждой новой итерацией накапливались паразитные артефакты, искажались пропорции, а исходная идея рассыпалась.

В версии 2.5 многошаговое редактирование наконец-то стабилизировали. Модель цепко удерживает контекст от шага к шагу: если вы вносите правку за правкой, база изображения не плывет, а нежелательные геометрические мутации сведены к минимуму. По-нашему, именно такой предсказуемости не хватало генеративной графике, чтобы стать полноценным рабочим инструментом для студийного продакшена, а не просто генератором случайных мудбордов.

Скетчи и готовые формы в интерфейсе

Вместе с обновлением весов изменился и сам диалоговый интерфейс. Работать с картинками теперь можно прямо от руки:

The image shows a man with a large afro hairstyle and a beard, wearing a black jacket with teal, pink, and purple panels, and a gold chain necklace. He is smiling and looking directly at the camera. The background features a blue sky with pink and blue neon lights, and a vintage-style boombox is visible in the backgrou
Фото: OpenAI
  • поддержка пользовательских набросков позволяет загрузить грубый черновой скетч и использовать его как жесткий композиционный каркас для финального арта;
  • встроенная библиотека шаблонов сокращает рутину под конкретные форматы, будь то быстрая сборка постеров или поиск знака для логотипа.

Для тех, кто привык встраивать нейросети в собственные пайплайны и сервисы, модель одновременно вывели в API. Доступ разделили на два независимых потока:

  • Sunburst — флагманская продвинутая версия для задач, где в приоритете максимальная детализация и сложное сведение;
  • Flare — упрощенная сборка, рассчитанная на высокую скорость отклика и менее требовательные сценарии.

Финансовую сторону вопроса разработчики пока держат на паузе. Точные тарифы и стоимость токенов для обеих версий API на момент официального релиза создатели так и не раскрыли.

В сухом остатке мы получаем редкий случай, когда апдейт целится не в абстрактную фотореалистичность, а в контроль. Когда картинка перестает мутировать от каждого комментария арт-директора, с генеративной графикой наконец можно работать как со слоями в графическом редакторе.

Ещё новости

Все новости →