Взлом Hugging Face: как ИИ-агенты атаковали платформу и почему коммерческие LLM мешали расследованию

Индустрия долго обещала, что автономные агенты возьмут на себя рутину и написание кода. На деле их первая успешная массовая реализация оказалась связана с автоматизацией взломов. Hugging Face раскрыли детали атаки на свою инфраструктуру, которая от начала и до конца управлялась системой ИИ-агентов. Вектор входа оказался банальным — уязвимости в пайплайне обработки датасетов, через которые вредоносный код выполнился на серверах. Никакой магии или сверхсложных алгоритмов, просто рой скриптов методично перебирал тысячи действий в песочницах, пока не нашел брешь и не начал горизонтальное перемещение по внутренним кластерам.
Вопрос в том, как защищаться от угрозы, которая масштабируется дешево и работает на машинной скорости. Команда платформы логично попыталась скормить 17 тысяч событий из логов коммерческим LLM для быстрого анализа. И здесь проявилась фундаментальная проблема текущего подхода к безопасности нейросетей. Провайдеры API заблокировали запросы, поскольку их встроенные фильтры не смогли отличить специалиста по безопасности с логами эксплойтов от хакера, пытающегося сгенерировать вредоносный код. Защитники оказались связаны по рукам корпоративными правилами.
В итоге расследовать инцидент пришлось с помощью открытой модели GLM 5.2, развернутой на собственных серверах платформы. Ситуация демонстрирует опасную асимметрию в противостоянии. Атакующие используют джейлбрейки или открытые веса без каких-либо этических лимитов, генерируя тысячи атак в минуту. Защитники же спотыкаются о заботливые фильтры коммерческих сервисов при попытке эти атаки проанализировать. Выходит, что для реального противодействия автоматизированным угрозам компаниям теперь критически важно держать под рукой локальные, нецензурируемые модели, иначе расследование остановится на первом же системном ограничении.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад