Современные мультимодальные модели отлично распознают статику, но сохраняют фундаментальную уязвимость при анализе видео. Проект Ghost Font эксплуатирует архитектурную слабость нейросетей — их неспособность связывать временные паттерны. Вместо привычного шрифтового файла генератор выдает короткий видеоряд, где символы формируются исключительно за счет направленного движения точек поверх шумового фона.
Если поставить видео на паузу, сообщение мгновенно сливается с фоном в нечитаемую текстуру. Поэтому стандартный подход визуальных ИИ-моделей, разбивающих ролик на последовательность отдельных фреймов, здесь полностью ломается. Для защиты от продвинутых агентов, способных написать скрипт для анализа векторов движения, внедрен дополнительный слой безопасности. При генерации алгоритм целенаправленно прячет в пиксельном шуме ложный текстовый след. Когда машина пытается математически вычислить траектории, она находит именно эту обманку, принимая ее за исходный текст.
Подобная механика ухода от покадрового анализа открывает прямой путь к созданию нового поколения CAPTCHA. Пока боты полагаются на статические фреймы, динамическое распознавание формы остается прерогативой человеческого зрения. Заодно проект служит надежным бенчмарком. Успешная машинная расшифровка такого текста без подсказок промптом станет четким сигналом появления настоящих video-native архитектур.
Поделиться:
Кофе как химический эксперимент: разбор лабораторной айдентики проекта Colon
Стек и пайплайн 3D-дженералиста: разбор VFX-шоурила Ильи Kekos