
Схемы без координат, роботы на диффузии и стикман против чужой верстки
Свежие инструменты визуализации, арт-интервенции в городе и софт, который экономит часы на продакшене
Когда генеративные модели переходят от картинок к управлению сервоприводами, а браузер спокойно крутит процедурный мегаполис на Bevy, дистанция между кодом и визуалом сокращается до пары кликов. На этой неделе софт демонстративно избавляет нас от рутины — отменяет возню с координатами в схемах, локально расшифровывает терабайты звука и собирает дизайн-системы быстрее, чем остывает фильтр-кофе.
Параллельно классический продакшен тоже ищет новые формы: уличные розыгрыши превращаются в виральные ролики с живой фактурой, а музейные скульптуры выходят прямо во дворы Марьиной Рощи без оглядки на белые кубы галерей.
Фальшивый кастинг в Нью-Йорке стал рекламой батончиков Unhinged

Человека перед камерой сначала спрашивают об имени и профессии, а через минуту требуют станцевать десять разных танцев подряд или вдребезги разбить гитару вместо игры на ней. Сооснователи независимого агентства The Circle Джефф Бертон и Хантер Хэмптон позвали ньюйоркцев на открытый кастинг за звание «лица бренда» протеинового кофейного батончика Unhinged. Подвох раскрылся позже: никакого закрытого отбора не существовало. Все пришедшие горожане автоматически попали в итоговые ролики, доказав авторскую мысль о том, что безумия хватает в каждом из нас.
Как устроен продакшен без сценария
Для дуэта основателей The Circle, которые больше десяти лет вели adidas, Volkswagen и Instagram в Johannes Leonardo, это дебютный независимый запуск. Денег на звездных амбассадоров у молодого продукта не нашлось, поэтому ставку сделали на чистую импровизацию. Чтобы ничего не упустить, оператор и сорежиссер Энтони Триполи развернул три камеры на разном удалении: они писали происходящее непрерывно со всех ракурсов, а на чистовой монтаж пошли даже режиссерский смех и реплики за кадром.
В проект вошли:
- Серия из восьми бесситуативных тизеров в аккаунте @always_unhinged, запущенная в сентябре
- Главный рекламный ролик, стартовавший 1 октября
- Персональные видео с кастинга каждого героя на протяжении октября и ноября
- Осенняя фотосессия от фотографа Брендана Викстеда

Техническую часть закрыли партнерские студии: кастингом занималась Шей Нильсен, звуком — Barking Owl, монтажом — Trim, а цветом и графикой — Blacksmith. Создатели признались, что хотели напомнить индустрии простую вещь: творчество всегда остается непредсказуемым хаосом, особенно когда от рекламы требуют строгих гарантий.
Нас подкупила смелость команды: вместо вылизанных раскадровок и фальшивых улыбок актеров они выкатили сырую человеческую странность, которая цепляет сильнее любого безупречного селебрити.
Золотое конфетти и длинный фокус в кампании Grey Canada для Special Olympics

Вместо физических хлопушек с блестками на площадке держали визуальную тишину: режиссер Крис Браун и продакшн ANIMALS отказались от пиротехники ради комфорта участников и перенесли взрывы сияющего золотого конфетти на этап постпродакшна. В кампании Joy Is Gold для Special Olympics Canada — организации, которая развивает инклюзивный спорт уже 57 лет, — компьютерные золотые всполохи вспыхивают ровно в те секунды, когда атлеты и их близкие переживают неподдельный триумф.
Съемка без скаутинга и очных проб

Собрать ролик на ограниченных ресурсах агентству Grey Canada и съемочной группе удалось всего за два дня. Классический скаутинг локаций отменили из-за сроков: Браун и оператор-постановщик Джон Глендон сами исследовали точки — включая местную закусочную — и на ходу адаптировали раскадровки под реальные интерьеры. Из всех людей перед объективом профессиональными актерами были лишь три человека. Остальных героев нашли среди спортсменов, волонтеров и членов их семей через портфолио и рекомендации, отказавшись от очных кастингов.

Технические решения продиктовала специфика площадки:
- Две камеры зарядили преимущественно длиннофокусной оптикой, чтобы операторы держались на дистанции и непрофессиональные исполнители не отвлекались взглядом на оптику.
- Наблюдательный документальный ритм сменили лишь в финале, когда камера перешла на динамичную съемку с рук.
- Группа постоянно преодолевала форс-мажоры: на натуре ломался электронный стабилизатор Ronin, съемки заливал дождь, а спортивные багги обгоняли съемочные машины.
- Сборку вели Крис Мерфи из Outsider Editorial и Доминик Боченский из Tantrum.
- Оригинальную музыку студия Rajakovic Electric написала с нуля за неделю до премьеры, когда авторам внезапно отказали в правах на утвержденную песню.
«Нас подмывало сделать громкий парадный гимн, но мы не хотели создавать впечатление, будто авторы ролика сами срежиссировали эту радость», — объясняет Браун. Для визуального продакшена это чистый пример того, как деликатный CG и строгая документальная дистанция работают сильнее постановочной драмы. Когда эмоция настоящая, камере достаточно просто отойти на шаг назад.
Мэтт Киттер показал Halfspace: среду моделирования на полях расстояний прямо в браузере

Представьте топографическую карту, на которой изолинии показывают не высоту холмов, а точные границы будущего 3D-объекта прямо внутри кода. Инженер Мэтт Киттер выложил Halfspace — экспериментальную среду разработки для твердотельного моделирования через поля расстояний (distance fields). Проект с апреля 2025 года пишется вручную на Rust без привлечения генеративного ИИ и служит интерактивной витриной для геометрического ядра Fidget. Главная практическая фишка подхода — создание безупречной «чистой» геометрии для физического производства и 3D-печати, где у формы всегда есть строгое разделение на внутреннее и внешнее пространство без скрытых дыр в полигонах.
Архитектура и диагностика формы
Моделирование строится на базовых примитивах (кубы, сферы, цилиндры), классических операциях CSG вроде объединения или вычитания и скриптах. Технически среда полностью опирается на связку современных открытых инструментов:
- Графический интерфейс собран на библиотеках
eguiиegui_dockдля гибкого управления окнами и рабочими вкладками; - За вычисления и рендеринг отвечает API
wgpu, а пользовательские сценарии обрабатываются встроенным языком Rhai; - Параллельные потоки распределяются через
Rayonиwasm-bindgen-rayonс собственным пулом воркеров для асинхронного рендеринга на GPU без подвисания интерфейса, а кроссплатформенное время считаетweb-time; - Модуль
fidget-wgpuпроизводит растеризацию, затенение и постобработку прямо на видеокарте без прогона данных через процессор, обеспечивая плавный отклик даже в веб-версии.
В отличие от привычных полигональных пакетов, Halfspace подсвечивает математические дефекты геометрии еще до экспорта. Интерфейс выводит градиенты и изолинии полей расстояний с цветовым разделением внутреннего и внешнего объемов. Это позволяет отлавливать разрывы первого рода (C0-дисконтинуаности) — коварные скачки значений, из-за которых автоматическое дифференцирование сбоит на нормалях и дает некрасивые пятна на шейдинге (например, на стыках виртуальной черепичной крыши). Сглаживая скорость градиента, автор добился чистого построения сеток и предсказуемого света.
Нас подкупило то, что сложный математический САПР теперь доступен по обычной ссылке в браузере через WebAssembly и WebGPU без установки тяжелого софта — хотя мобильный Safari пока капризничает из-за сырой поддержки технологии и жестов мультитача. Готовую геометрию можно забрать в виде растровых картинок или полигональных треугольных сеток. Проект полностью открыт на GitHub под лицензией MPLv2 и пока носит статус исследовательского полигона — отличный повод заглянуть под капот нетривиальной геометрии без страха сломать рабочий конвейер.
Генератор дизайн-систем UI UX Pro Max 2.0 собирает визуал за секунды

Вместо двух дней на сборку мудборда и базовых стилей — один текстовый запрос вроде лендинга для бьюти-спа. Открытый проект ui-ux-pro-max-skill дорос до версии 2.0, превратившись в полноценный логический движок для интерфейсов. Инструмент за секунды разбирает задачу на атомы и выдает готовую спецификацию: структуру страницы, графический стиль, палитру, типографику, антипаттерны и предстартовый чек-лист.
Под капотом обновления собрана внушительная библиотека инженерных и визуальных ограничений:
- 192 индустриальных правила для категорий от финтеха, SaaS, ритейла и медицины до Web3 и пространственных вычислений;
- 79 стилей интерфейса, куда вошли 50 активных направлений — включая брутализм, минимализм, Bento Grid, глассморфизм, клейморфизм, неоморфизм, темную тему и AI-Native UI, — а также 29 запасных и 9 устаревших;
- 192 цветовые палитры под разные типы продуктов и 74 шрифтовые пары с интеграцией Google Fonts;
- 25 форматов аналитических графиков и прямая адаптация под 22 технологических стека (React, Next.js, Astro, Vue, Nuxt.js, Svelte, Tailwind CSS, shadcn/ui, SwiftUI, Flutter, Three.js, Jetpack Compose, React Native, Angular, Laravel, WPF, WinUI 3);
- 119 практических UX-требований против багов на верстке: корректный перенос длинных ссылок без поломки контейнеров, сворачивание списков тегов через оператор «+n», запрет на передачу статусов исключительно цветом и обязательный учет системной настройки prefers-reduced-motion при прерывании анимаций.
Пакет ui-ux-pro-max-cli уже лежит в npm и на GitHub, подключаясь к любым внешним ИИ-агентам. Нас подкупило, что генератор не пытается рисовать пиксели наугад, а отдает строгий каркас по правилам продакшена. Отличный повод навсегда забыть про мучительный этап чистого листа.
Локальная расшифровка звука и видео в бесплатном приложении Buzz

Часовой черновик интервью с клиентом больше не нужно скармливать облачным сервисам под страхом нарушить NDA. Разработчик Чиди Вильямс развивает десктопный инструмент Buzz — открытый клиент на базе семейства моделей OpenAI Whisper, который переводит и транскрибирует аудио и видео прямо на вашей машине без отправки файлов на внешние серверы и без возни с настройкой виртуального окружения.
Возможности и архитектура
Программа распространяется под свободной лицензией MIT и задействует мощности локального железа. На компьютерах Mac работает нативная оптимизация под чипы Apple Silicon (семейства M1, M2, M3 и M4) через фреймворк MLX, для видеокарт NVIDIA предусмотрено CUDA-ускорение, а реализация Whisper.cpp с поддержкой Vulkan запускается практически на любых графических процессорах, включая интегрированные решения. Через интеграцию с платформой Hugging Face можно подключать альтернативные модели архитектуры Transformer. Под капотом собрано все необходимое для монтажа и черновой работы со звуком:
- Источники данных: импорт локальных аудио- и видеофайлов, скачивание и распознавание роликов по прямым ссылкам с YouTube, а также захват речи с микрофона в реальном времени;
- Чистка и диаризация: предварительное разделение аудиодорожки для фильтрации фонового шума и встроенное распознавание нескольких говорящих;
- Экспорт готового текста: сохранение расшифровок со встроенными таймкодами в виде обычного TXT или готовых файлов субтитров в форматах SRT и VTT;
- Интерфейс монтажера: встроенный плеер с поиском по репликам, регулировкой скорости воспроизведения, горячими клавишами и отдельным окном презентации для вывода субтитров на экран во время живых выступлений;
- Автоматизация пайплайна: интерфейс командной строки CLI для скриптов, режим слежения за папкой (Watch Folder) для автоматической пакетной обработки новых файлов и система плагинов с генерацией AI-суммаризаций и форматированием длины строк.

Для дизайнеров и видеомонтажеров это готовый способ вытащить субтитры из черновых съемок или нарезать длинный подкаст на цитаты без абонентской платы и риска слить конфиденциальные материалы. Нас подкупило, что утилита не требует терминала: для Windows инсталлятор доступен на SourceForge (система может предупредить о запуске файла без цифровой подписи), сборки для Linux распространяются через Flatpak на Flathub, Snap Store и в формате AppImage, а владельцы Mac загружают DMG-образ напрямую. Правда, на macOS приложение теперь требует Apple Silicon — поддержка систем на базе Intel завершилась на релизе 1.4.5. Разработчики могут поставить проект через PyPI командой pip install buzz-captions на Python 3.12 с утилитой FFmpeg; для активации CUDA 12.9 на Windows понадобятся библиотеки NVIDIA (cublas, cuda-runtime, cuda-cupti) и PyTorch версии 2.8.0.

Когда весь продакшен упирается в дедлайны, приятно иметь под рукой софт, который молча забирает ссылку с YouTube и отдает чистый таймкод прямо в монтажку.
ММОМА и MR Group спустили современное искусство с постаментов в Марьиной Роще

Никаких музейных смотрителей и бархатных ограждений: в Марьиной Роще искусство выставили буквально под ноги прохожим. На территории жилого квартала «МОД» запустили публичное пространство «Парк скульптур ММОМА x MR» — совместный проект Московского музея современного искусства и девелопера MR Group, запущенный по внутренней программе Art&Culture.
Главный жест кураторов — отказ от классических постаментов. Все инсталляции стоят на уровне глаз зрителя прямо вдоль привычных пешеходных дорожек:

- экспозиция собрала работы отечественных авторов разных поколений и направлений;
- часть объектов художники создали специально под ландшафт квартала;
- другие работы переработали и масштабировали для открытой городской среды;
- для навигации авторы запустили аудиогид и регулярные экскурсионные туры.

Нас подкупило, как авторы обошлись с контекстом: уличная пластика здесь не выглядит случайным декором к новостройкам, а пересобирает восприятие всего двора. Когда музейные работы встают на один уровень с асфальтом, городское пространство наконец перестает казаться безжизненным 3D-рендером.

Meta VR Glasses сменили тяжелый шлем на легкие очки с внешним блоком

Менее ста граммов на переносице вместо полукилограммового пластикового козырька — так выглядит попытка Meta вытащить пространственные экраны из разряда тяжелой экипировки в повседневный рабочий обиход. Новое устройство смешанной реальности за $1299 поступит в продажу следующей весной. По форме это непрозрачные лыжные очки без массивных затылочных ремней: они плотно сидят на лице сами по себе, а всю вычислительную начинку — чип, оперативную память и хранилище — вынесли в отдельный 300-граммовый карманный блок на кабеле. Нас подкупило решение разгрузить шею, хотя клипса на брюках во время работы заметно греется.
Дисплеи, оптика и управление

Внутри установлены блинчатые линзы с пазами для сменных диоптрийных вставок, а картинку реального мира внутрь передают четыре сквозные камеры:

- Матрицы выдают 2412 × 2288 точек на каждый глаз при плотности 37 пикселей на градус.
- Поле зрения урезано до 70 градусов — это скромнее традиционных шлемов линейки Quest, так что охватить всё взглядом без поворота головы не выйдет.
- Интерфейс обходится без обязательных контроллеров: вы смотрите на объект и смыкаете указательный палец с большим для клика, а скроллинг завязан на движение большого пальца вдоль боковины указательного (хотя манипуляторы Touch Plus к системе подключить все-таки можно).
В развлекательном блоке показывают 3D-записи матчей NBA, концерты Билли Айлиш и свежий Beat Saber, но главный интерес здесь — связка с Mac или ПК на Windows. Гарнитура разворачивает перед глазами до трех виртуальных дисплеев с поддержкой ультраширокого формата, а опция Surface Keyboard проецирует цифровую клавиатуру и тачпад прямо на любую плоскую столешницу. Правда, тактильной отдачи у таких клавиш нет, а перспектива слегка уменьшает их размер.
Для дизайнеров и монтажеров это редкий шанс получить мультимониторный сетап в любой кофейне, уместив всю рабочую станцию в карман куртки. Платить за легкость приходится постоянным верчением головы из-за узкого обзора — три огромных холста одновременно перед глазами просто не помещаются.
FLUX научился крутить сервоприводы: Black Forest Labs выпустила Action для роботов

Тот же диффузионный пайплайн, что собирал кинематографичные шоты, теперь управляет физическими шарнирами манипулятора. Black Forest Labs выкатила семейство моделей FLUX 3 Action на 7 миллиардов параметров — и перенесла генерацию из окна предпросмотра прямо в физический мир. Опираясь на опыт линеек FLUX.1, FLUX.1 ONNX и FLUX.2, команда взяла базовую видеомодель FLUX 3 и дообучила её на записях роботов. В обучающих данных каждый кадр с камеры синхронизирован с телеметрией: положениями суставов и физическими жестами.
Нейросеть решает две задачи параллельно: восстанавливает из шума будущие кадры видео и рассчитывает траекторию механики. На вход подаются текстовая задача, картинка с объективов и текущее состояние приводов. На выходе система выдаёт прогноз движения суставов, команды для захвата и ожидаемую визуальную картинку. Робот делает порцию шагов, считывает новые кадры и тут же пересчитывает следующие действия.

В коллекцию вошли три компонента:
- black-forest-labs/flux-3-action-base — базовый слой адаптации действий с общими замороженными видео- и текстовыми энкодерами;
- black-forest-labs/flux-3-action-so101 — модель политики управления SO-101 LeRobot на 7B с готовым рецептом task-LoRA и сохранёнными процессорами;
- black-forest-labs/flux-3-action-droid — проверенная модель политики DROID на 7B с дополнительными вариантами оптимизации в подпапках.
На тестах в симуляторе RoboLab-120 модель показала 42.9% успешных попыток, обогнав конкурента Cosmos 3 Nano на 16B с его 36.8%. Под каждое новое «железо» систему придётся дообучать, но база уже собрана. Код опубликован на GitHub под лицензией Apache 2.0, веса лежат на Hugging Face под FLUX Community License, а подробный отчёт — на сайте компании.

Для продакшена это сигнал: генеративные модели выходят за пределы экрана и начинают двигать камеры на реальных съёмочных ригах.
Видеоаватары Gemini 3.8 Live вышли в продакшен с нативным звуком и мимикой

Собеседник на экране смотрит прямо в глаза, шевелит губами точно в такт своей речи и не сбивается, если его перебить на полуслове. Google Cloud перевел модель Gemini 3.8 Live с функцией Live Avatar в общий доступ для корпоративных клиентов Gemini Enterprise. Разработку впервые показали на Google Cloud Next 2026, а теперь интерактивные видеоаватары готовы к внедрению в мобильные приложения, веб-сервисы и физические интерактивные киоски.
В основе решения лежит нативная архитектура speech-to-speech, избавляющая систему от задержек двойной конвертации голоса в текст и обратно.
Возможности системы
- Синхронизация движения губ персонажа с генерируемой речью в реальном времени.
- Одновременная обработка живого видео с камеры, демонстрации экрана и микрофонного звука.
- Вызов инструментов и выполнение фоновых API-запросов прямо во время беседы с озвучиванием промежуточного статуса.
- Автоматическое определение и поддержка 97 языков.
Безопасность выстроили жестко: клиентам предлагают библиотеку готовых пресетов, а создание кастомных аватаров требует верификации и внесения в allowlist. Все видео- и аудиопотоки маркируются невидимыми цифровыми водяными знаками SynthID. Доступ к API открыт на инфраструктуре в США и ЕС с опцией выделенной пропускной способности. Партнеры уже запустили первые кейсы: Equal AI обрабатывает свыше миллиона живых звонков в день на девяти индийских языках, платформа Specs фиксирует снижение задержек и возросшую точность детектора голоса, а Salesforce интегрирует модель в сервисы Agentforce. В Cox Automotive систему встроили в поиск машин на Autotrader с подсветкой экрана прямо по ходу разговора. «Покупатели все чаще ждут, что смогут описать задачу своими словами, а не продираться сквозь фильтры и меню», — объясняет директор по продукту Cox Automotive Марианна Джонсон.

Для продуктовых дизайнеров это сигнал пересобирать привычные сценарии обслуживания. Вместо громоздких каталогов и длинных форм интерфейс сжимается до окна с цифровым консультантом, который видит экран пользователя и реагирует без мучительных пауз. Пожалуй, классический UI начинает медленно уступать место режиссуре диалога.

Cartopolis перенёс трёхмерную копию городов в браузер на движке Bevy

Вместо долгой сборки городского квартала в тяжёлом 3D-пакете — готовая сцена прямо в окне браузера с честным рельефом, живым солнцем и реальной высотой каждого карниза. Проект Cartopolis выложил в открытый доступ интерактивную трёхмерную карту мира на игровом движке Bevy и языке Rust под свободными лицензиями MIT и Apache-2.0. Все пользователи здесь делят одно виртуальное пространство: можно бродить по улицам аватаром, обсуждать ракурсы через пространственный голосовой чат и делиться ссылкой на точную точку обзора камеры.
Платформа собирает геометрию из открытых баз, погодных спутников и муниципальных реестров. Уровень проработки пока контрастный: весь остальной мир опирается на плоский рельеф OpenStreetMap с геокодированием через Nominatim, Overpass API и тайлы VersaTiles в схеме Shortbread, тогда как Нидерланды превращены в детальный цифровой двойник.

Что умеет и из чего собрана система
- Модели зданий: регистр BAG и геометрия 3DBAG уровня детализации LoD2.2 от TU Delft на основе данных Kadaster и PDOK с высотой этажей, годами постройки и планировками;
- Рельеф и окружение: высотные растры DTM/DSM из архива AHN, аэрофотосъёмка Beeldmateriaal Nederland, а также точные позиции деревьев, фонарей и контейнеров от муниципалитета Гронингена;
- Динамика города: движение общественного транспорта в реальном времени по фидам OVapi и NDOV;
- Атмосфера: суточный цикл, звёздный каталог HYG Database v4.1, прогнозы облачности NOAA GFS и погодные сводки MET Norway;
- Работа с ассетами: загрузка собственных скриптов, 3D-моделей и прямая подстановка архитектурных IFC-файлов через HTTP API;
- Коммуникация и безопасность: пространственный звук, локальный чат с ограничением по расстоянию, сквозное шифрование личной переписки по протоколу MLS (модуль
cartopolis_e2ee) и серверная модерация с веб-панелью администратора.
Архитектура разбита на модульные крейты: графический клиент cartopolis, бэкенд мультиплеера cartopolis_simulator на Tokio и SQLite, конвейер геоданных cartopolis_atlas, математический блок cartopolis_geo и форк библиотеки big_space для расчёта планетных координат.
Опробовать платформу можно на cartopolis.org через браузер с поддержкой WebGPU. Для локального запуска авторы подготовили бинарники под Windows и Linux (потребуются процессорные инструкции AVX2 и FMA) и пакет APK под Android 9+ для чипов arm64. Для сборки из исходников понадобятся компилятор C, драйвер GPU и инициализированный Git LFS. Архитекторам и моушн-дизайнерам этот инструмент даёт главное — возможность мгновенно примерить объект в настоящем ландшафте без долгого моделирования контекста вокруг.

Вышел reladraw 0.8 с относительной версткой схем кодом без подгона координат

Знакомая боль: автоматические генераторы вроде Mermaid или Graphviz упрямо раскидывают стрелки как вздумается, а в визуальных редакторах вроде draw.io приходится часами двигать пиксели руками или скармливать агентам громоздкие координаты. Релиз reladraw 0.8.0 предлагает компромисс. Это легковесный язык описания диаграмм, в котором блоки привязываются друг к другу человеческими правилами — «правее», «ниже» или «вровень» — избавляя от ручной подгонки сеток и случайных скачков верстки.
Архитектура и синтаксис
Под капотом нет лишнего балласта: парсер, движок раскладки и генератор чистого SVG написаны на TypeScript с нулевыми зависимостями. Синтаксис пока формируется и может меняться от версии к версии, но уже умеет четко раскладывать логику:
- Объявление сущностей и иерархий: через команды вроде
node app "Web app", вложенный интерфейсnode app.ui "Interface"и сервисы под нимnode app.api "API" below app.ui. - Горизонтальные и вертикальные привязки: например, база данных ставится сбоку и выравнивается по высоте конструкцией
node store "Database" right of app level with app. - Направление коннекторов: ребра задаются точно от грани к грани, как в
edge app.api -> store "queries" from: right to: left.

Инструмент можно поставить глобально через npm (npm install -g reladraw) и рендерить векторные файлы напрямую в терминале командой reladraw diagram.reladraw -o diagram.svg, либо собрать вручную из репозитория. Нас особенно подкупила интеграция с нейросетями: через команду npx skills add reladraw/reladraw -g синтаксис скармливается ассистентам вроде Claude Code, Cursor, Copilot и Codex. Правда, навык копируется в среду при установке — обновлять его при выходе новых версий придется вручную. Код распространяется под лицензией Apache-2.0 (без прав на логотип и имя), а создатели сейчас активно собирают сложные схемы, на которых алгоритм спотыкается.

Для арт-директора и продуктового дизайнера это редкий шанс поручить верстку пайплайнов и технической графики ИИ-агентам, не боясь получить кашу из связей. Когда схема пишется прозрачным кодом, менять логику проекта можно парой правок в текстовом файле прямо перед презентацией.
Apple выложила открытую визуальную модель LensVLM-9B для тяжелых документов

Представьте стостраничный брендбук или презентацию с кучей графики, которую нужно быстро скормить нейросети без риска повесить сервер. Исследовательская группа Apple AI/ML Research выложила в открытый доступ модель LensVLM-9B на девять миллиардов параметров. В ее основе лежит Qwen3.5-9B. Вместо того чтобы обрабатывать тяжелые страницы целиком в высоком разрешении, система берет предварительно сжатые превью документов и только при необходимости точечно распаковывает нужные листы до исходного качества.
Архитектура, инструменты и запуск
Модель ориентирована на длинные визуальные контексты и представлена в формате Safetensors с тензорами BF16. В научной статье от 7 мая 2026 года авторы Рой Се, Дэн Фридман, Донхан Ю, Бовэнь Пан, Кристофер Фифти, Чан-Хён Ким, Сяньчжи Ду, Чжэ Гань, Вивек Ратход и Бхуван Дхингра описали алгоритм селективного расширения контекста. Система поддерживает три фиксированных уровня сжатия: 5x, 10x и 15x.
Запустить и протестировать разработку можно через целый набор привычных креаторам и инженерам инструментов:
- Hugging Face Transformers с пайплайном
image-text-to-text, классамиAutoProcessorиAutoModelForMultimodalLM; - локальный сервер vLLM через pip или Docker с OpenAI-совместимым API;
- движок SGLang через команду
sglang.launch_serverили контейнеры lmsysorg/sglang под GPU; - быстрый запуск командой
docker model run hf.co/apple/LensVLM-9B; - квантованные версии для Ollama, LM Studio и llama.cpp;
- демо-пространства на Hugging Face —
Mike0021/LensVLM-9B-demoиhugging-apps/lensvlm-9b-demo; - скрипт
demo.pyиз репозиторияapple-aiml-research/ml-lensvlmна GitHub, куда передаются файл, текстовый промпт и коэффициент сжатия.
Веса распространяются под лицензией Apple Machine Learning Research Model License, а сопутствующий код доступен по Apple Sample Code License.
Для дизайн-команд и арт-директоров это готовый локальный ассистент, способный переваривать толстые гайдлайны, мудборды и раскадровки на обычном рабочем железе. Нас подкупило, что Apple решила не прятать технологию внутри системы, а отдала веса сообществу. Пожалуй, именно так и должен выглядеть аккуратный поиск по тяжелой верстке без лишних затрат видеопамяти.
Стикман против верстки: Destroy Any Website превращает чужие сайты в полигон для пальбы

Маленький нарисованный человечек зависает на реактивном ранце над главной страницей Википедии и выпускает струю из огнемета прямо в энциклопедические абзацы. Разработчик Юго Дюпре и проект Sprite Fusion выпустили браузерную песочницу Destroy Any Website, которая позволяет вбить адрес абсолютно любого ресурса и методично разнести его интерфейс в щепки. Демонстрация в соцсети X мгновенно собрала 2,7 миллиона просмотров и 45 тысяч лайков — кажется, желание физически расправиться с чужой кривой версткой знакомо слишком многим арт-директорам.
Как устроена веб-аннигиляция
Проект работает исключительно на десктопах и ноутбуках (со смартфона зайти не выйдет) по адресу destroy.spritefusion.com. Скрипт подтягивает указанный URL, превращая заголовки, кнопки и медиафайлы в физические платформы, которые разлетаются на куски от попаданий. Разносить чужие сайты можно в одиночку или в мультиплеере — хост создает сессию, после чего команда наблюдает строку прогресса разрушений в процентах и финальные итоги матча. В интерфейсе предусмотрели переключатели звука, фона, меню настроек и ссылку на сообщество в Discord.
Управлять стикманом предлагают привычной раскладкой:
- Бег на клавиши A, D или стрелки, падение сквозь элементы страницы — удержанием S.
- Прыжки на W или пробел: двойной клик делает сальто, а долгое зажатие включает полет.
- Стрельба и прицеливание левой кнопкой мыши, бросок гранаты — правой.
- Смена семи видов оружия (от огнемета до других стволов) цифрами от 1 до 7 или колесом мыши.
Для авторов контента Дюпре придумал отдельную опцию встраивания Embed to your website. На свой ресурс можно повесить светлый или темный кликабельный бейдж с надписью Destroy this website — и выдать читателям легальный инструмент для сброса пара. Нас подкупило, как точно интерактивная физика отзывается на каждый выстрел: верстка ломается натурально, шумно и в реальном времени. Лучший способ пережить затянувшееся согласование правок — сжечь макет заказчика из огнемета.






