Uni-1
Мультимодальная модель рассуждений, превращающая сложные визуальные идеи в пиксели по референсам

Uni-1 заходит на территорию визуального продакшена не как привычный диффузор, а как мультимодальная модель рассуждений. Разработчики научили систему считывать намерение автора, удерживать пространственную логику сцены и отвечать на точечные указания — то есть буквально думать над кадром в связке с креатором.
Что умеет
- Логически мыслить в кадре: модель опирается на здравый смысл при достраивании сцен, пространственные взаимосвязи объектов и физическую правдоподобность трансформаций.
- Работать по жестким референсам: алгоритм принимает исходные изображения в качестве ориентиров и держит контроль над источниками (в тестах задействуют от одного до восьми входных изображений).
- Учитывать культурный контекст: система ориентируется в визуальных эстетиках, мемах и манге, а также удерживает характер персонажа на портретах и кадрах в полный рост.
- Редактировать и генерировать с нуля: инструмент умеет собирать изображения по тексту, менять готовые кадры и выполнять перенос стиля. В бенчмарках слепого человеческого голосования модель занимает первую строчку по общему качеству, стилизации и генерации по референсам.
Цены и доступ
Доступ к API сейчас распределяют через лист ожидания. Тарификация построена на токенах: миллион входных текстовых токенов стоит $0.50, графических — $1.20, вывод текста и этапа рассуждений обойдется в $3.00, а вывод сгенерированных пикселей — в $45.45 за миллион токенов. В пересчете на изображение размером 2048 пикселей генерация из текста стоит $0.0909, редактирование или генерация с одним референсом — $0.0933, а сложный пайплайн с восемью референсами — $0.1101 за кадр.
Для арт-директоров и концепт-художников здесь важна управляемость: если модель действительно удерживает референсы и логику сцены, сборка раскадровок и мудбордов перестанет быть слепой лотереей с промптами.


