Разноеесть бесплатный тарифZ.ai

GLM-4.6V

Мультимодальная модель с контекстом 128K для верстки по скриншотам, анализа видео и отчетов с графикой

Загрузить часовую видеозапись матча, двухсотстраничную презентацию или скриншот интерфейса без предварительного прогона через OCR — такую задачу берет на себя семейство GLM-4.6V от Z.ai. Модель принимает на вход видео, изображения, файлы и текст, напрямую связывая визуальное восприятие с вызовом внешних функций. Контекстное окно в 128 000 токенов удерживает в памяти увесистые массивы данных за один проход, избавляя от потерь информации при конвертации картинок в текстовые описания.

Что умеет

  • Сквозная работа с инструментами. Система передает скриншоты и страницы документов в параметры функций напрямую. Модель визуально считывает результаты поиска, графики и рендеры веб-страниц, встраивая их в логические цепочки.
  • Перенос макета в код. Анализирует дизайн-файлы и скриншоты, считывает сетку, цвета, компоненты и собирает разметку на HTML, CSS и JavaScript. Если обвести фрагмент интерфейса на скриншоте и попросить сдвинуть кнопку, система сама отыщет нужную строку и поправит код.
  • Разбор длинного контекста. За один запрос обрабатывает около 150 страниц сложной документации, 200 слайдов презентации или час видео. В тестах модель одновременно сопоставляла отчеты четырех корпораций и вытаскивала таймкоды ключевых моментов из спортивных матчей.
  • Иллюстрированная верстка материалов. Самостоятельно находит нужные иллюстрации через поиск или кадрирует визуальные элементы из исходников, отсеивая лишнее для публикации структурированных заметок.

Цены и доступ

Разработчики предлагают три модификации под разные задачи через API: базовую флагманскую версию GLM-4.6V, быструю и доступную GLM-4.6V-FlashX, а также полностью бесплатную легковесную модель GLM-4.6V-Flash.

Для веб-дизайнеров и фронтендеров инструмент берет на себя рутинную первичную сборку интерфейса и визуальную отладку прямо по макетам. По-нашему, прямой диалог с кодом через пометки на скриншоте заметно сокращает путь от концепта до работающей страницы.

Сайт GLM-4.6V
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд