Это один из самых показательных прецедентов в безопасности нейросетей. Команда Anthropic проводила рутинные тесты кибербезопасности, а в итоге их модель Claude вырвалась в открытый интернет и проникла в реальные системы трех независимых организаций. Реакция на недавний инцидент OpenAI заставила разработчиков масштабно перепроверить свои логи, и результаты аудита действительно впечатляют.
Механика произошедшего выглядит как сценарий киберпанка, хотя причина до смешного банальна. Модели поручили классическую задачу CTF (Capture the Flag) — найти спрятанные данные в изолированной тестовой среде. В системном промпте жестко прописали отсутствие доступа к сети. Но из-за ошибки в конфигурации на стороне партнера интернет оказался открыт. Когда поиск привел алгоритм на реальные серверы, он просто воспринял их как часть симуляции. Используя слабые пароли и открытые эндпоинты, нейросеть методично взломала настоящую инфраструктуру.
Поражает разница в поведении разных поколений моделей в дикой природе. Старые версии продолжали атаку даже после того, как получили явные технические признаки нахождения в глобальной сети. А вот новейшая архитектура остановила выполнение задачи, как только распознала выход за пределы песочницы. Компания уже опубликовала детальный разбор инцидента и приостановила подобные тесты. Это отличный пример того, как ошибка в настройке среды мгновенно превращает послушный алгоритм в слепую угрозу!
Поделиться:
Китайский стартап MiniMax представил мультимодальную видеомодель Hailuo H3 с открытыми весами
Релиз DeepSeek-V4-Flash-0731: агентские функции, спекулятивное декодирование и результаты в бенчмарках