Новость

ИИ-агенты OpenAI без спроса пробили себе выход в интернет и взломали Hugging Face

Фото: OpenAI

«Holy shit reader is ADMIN? We can read config/users!» — такую фразу оставил в логах один из ИИ-агентов OpenAI, обнаружив, что случайно получил права администратора во внутренней системе компании. Эту и другие цепочки рассуждений моделей компания опубликовала сама — в отчёте об инциденте, который прямо называет «предупредительным выстрелом» для всей индустрии.

История началась в мае 2026 года во время рутинных внутренних оценок кибербезопасности. Несколько исследовательских моделей, включая внутреннюю модель масштаба GPT-5.6 Sol, которую в отчёте называют IM1, тренировались решать заведомо сложные задачи на взлом систем — без доступа в интернет и без возможности общаться друг с другом, поскольку агенты должны были оставаться изолированными. Но 12 мая один агент оставил в системе управления пакетами Artifactory записку с просьбой о недостающем файле — для другого агента, который мог её прочитать. Так появился первый, случайно изобретённый канал связи между изолированными моделями.

Дальше события развивались по нарастающей. 26 мая агент добился доступа в интернет через уязвимость, заставив Artifactory отправлять запросы за него. 26 июня агенты нашли уязвимость в обновлении токенов и получили права администратора самой системы Artifactory. К 4 июля активность агентов стала настолько интенсивной, что сервис просто упал, и только тогда команда безопасности OpenAI открыла инцидент, заблокировала известный путь повышения привилегий и пересобрала систему заново.

Это не остановило агентов. Уже 8 июля они восстановили канал связи, кодируя сообщения в именах директорий, а 10 июля один из них реконструировал и проверил 14 публично засвеченных ключей доступа к Hugging Face с правом записи. На следующий день агенты нашли уязвимость нулевого дня в обработке файлов формата HDF5 на серверах Hugging Face, вытащили через неё учётные данные рабочих узлов и с их помощью выполнили произвольный код на инфраструктуре сервиса. За два следующих дня доступ расширился с одного рабочего узла до уровня администратора на нескольких кластерах Hugging Face, а агенты собрали учётные данные от Kubernetes, баз данных, очередей сообщений и облачных сервисов в четырёх регионах. 13 июля агенты подобрались и к самому Artifactory — через уязвимость в обработке пакетов получили ключ подписи и подделали администраторские права. Только 19 июля система безопасности OpenAI заметила подозрительную активность с идентификационными вызовами API, и компания остановила все активные тестовые прогоны.

На этом этапе агенты, по словам OpenAI, начали описывать себя в переписке друг с другом как «рой» или «коллектив», распределяя задачи между собой и объединяя усилия для обхода всё новых барьеров.

OpenAI подчёркивает: ни один человек не давал агентам команду взламывать Hugging Face — это результат того, что модели, стремясь решить назначенную им задачу на киберполигоне, сами нашли и связали между собой несколько уязвимостей в реальной инфраструктуре. Компания привлекла внешних консультантов, включая CrowdStrike, опубликовала полный технический отчёт и параллельно заказала независимое расследование у METR и Redwood Research — те выпустили собственный отчёт в тот же день.

В ответ OpenAI обещает более строгие требования к согласованности моделей на всех этапах жизненного цикла, более изолированные песочницы, более жёсткий контроль доступа к интернету и к весам моделей, а также значительно больше вычислительных мощностей — специально на мониторинг цепочек рассуждений, чтобы быстрее реагировать на подобное поведение. Формулировка компании звучит скорее как признание, чем как успокоение: модели уже достаточно мощны, настойчивы и способны к координации, чтобы без должных барьеров находить и использовать бреши в защите сразу нескольких систем — и вскоре такими же возможностями будут обладать и внешние модели, включая открытые.

Фото: OpenAI

Ещё новости

Все новости →