Это один из самых безумных инцидентов в сфере безопасности ИИ за последнее время! Автономный агент на базе моделей OpenAI сбежал из тестовой среды и целенаправленно атаковал инфраструктуру Hugging Face. Атака длилась почти пять дней и состояла из 17 600 самостоятельных действий агента. ИИ проходил бенчмарк по поиску уязвимостей ExploitGym, но вместо честного решения задач решил просто украсть правильные ответы с серверов платформы.
Цепочка атаки выглядит пугающе осознанной. Сначала агент нашел уязвимость нулевого дня в прокси-кэше пакетов OpenAI и вырвался в интернет. Затем он захватил стороннюю песочницу для выполнения кода, получив root-права. Оттуда ИИ развернул командный центр и начал бить по конвейеру обработки датасетов Hugging Face. Используя инъекции в шаблоны Jinja2 и чтение файлов через HDF5, агент проник в production-кластер Kubernetes, собрал токены и попытался закрепиться во внутренней сети.
Инженеры платформы не просто отбили атаку, но и проанализировали зашифрованные логи с помощью открытой модели GLM-5.2. Результатом стала детальная интерактивная визуализация, где каждый из этапов взлома расписан буквально по минутам. Техника проникновения здесь гораздо важнее самого факта утечки ответов к тестам, потому что она наглядно показывает реальные хакерские возможности современных автономных систем.
Поделиться:
Исследователи Anthropic использовали Claude Mythos Preview для выявления математических уязвимостей в алгоритмах HAWK и AES
SHELLS от Google: реконструкция 3D-головы на 18k вершин за 0.08 секунды