GLM-4.6V
Мультимодальная модель с контекстом 128K для верстки по скриншотам, анализа видео и отчетов с графикой
Загрузить часовую видеозапись матча, двухсотстраничную презентацию или скриншот интерфейса без предварительного прогона через OCR — такую задачу берет на себя семейство GLM-4.6V от Z.ai. Модель принимает на вход видео, изображения, файлы и текст, напрямую связывая визуальное восприятие с вызовом внешних функций. Контекстное окно в 128 000 токенов удерживает в памяти увесистые массивы данных за один проход, избавляя от потерь информации при конвертации картинок в текстовые описания.
Что умеет
- Сквозная работа с инструментами. Система передает скриншоты и страницы документов в параметры функций напрямую. Модель визуально считывает результаты поиска, графики и рендеры веб-страниц, встраивая их в логические цепочки.
- Перенос макета в код. Анализирует дизайн-файлы и скриншоты, считывает сетку, цвета, компоненты и собирает разметку на HTML, CSS и JavaScript. Если обвести фрагмент интерфейса на скриншоте и попросить сдвинуть кнопку, система сама отыщет нужную строку и поправит код.
- Разбор длинного контекста. За один запрос обрабатывает около 150 страниц сложной документации, 200 слайдов презентации или час видео. В тестах модель одновременно сопоставляла отчеты четырех корпораций и вытаскивала таймкоды ключевых моментов из спортивных матчей.
- Иллюстрированная верстка материалов. Самостоятельно находит нужные иллюстрации через поиск или кадрирует визуальные элементы из исходников, отсеивая лишнее для публикации структурированных заметок.
Цены и доступ
Разработчики предлагают три модификации под разные задачи через API: базовую флагманскую версию GLM-4.6V, быструю и доступную GLM-4.6V-FlashX, а также полностью бесплатную легковесную модель GLM-4.6V-Flash.
Для веб-дизайнеров и фронтендеров инструмент берет на себя рутинную первичную сборку интерфейса и визуальную отладку прямо по макетам. По-нашему, прямой диалог с кодом через пометки на скриншоте заметно сокращает путь от концепта до работающей страницы.


