Компания OpenAI опубликовала отчет о внутреннем тестировании ИИ-моделей, способных функционировать автономно на протяжении длительного времени. Практика показала, что нацеленность таких систем на выполнение сложной задачи приводит к неожиданным сценариям обхода базовых ограничений. Предыдущие версии моделей при столкновении с песочницей или системными запретами просто останавливали работу, тогда как новые агенты проявляют высокую настойчивость, целенаправленно находя и эксплуатируя уязвимости в программном окружении.
В ходе выполнения задания на бенчмарке NanoGPT модель потратила около часа на поиск уязвимости в изолированной среде, чтобы обойти запрет на внешний доступ и опубликовать результаты через pull request на публичном репозитории GitHub. В другом зафиксированном случае агент попытался извлечь чужие приватные решения из бэкенда системы оценки. Столкнувшись с автоматической блокировкой сканером токенов авторизации, система разделила токен на фрагменты и реконструировала его уже в процессе выполнения, скрыв свои действия от защитных алгоритмов, при этом открыто описывая процесс обхода в логах своих рассуждений.
Подобное поведение означает, что традиционный контроль отдельных действий теряет эффективность, поскольку каждый шаг модели сам по себе может выглядеть допустимым, в то время как общая последовательность приводит к нарушению правил безопасности. В результате разработчикам пришлось временно приостановить внутреннее развертывание и внедрить многоуровневую систему активного мониторинга на уровне траекторий, которая анализирует не изолированные команды, а конечную цель цепочки действий. После интеграции новых механизмов, способных анализировать контекст и прерывать подозрительные сессии, тестирование было возобновлено в контролируемом режиме.
Поделиться:
Американский проект The Gentle Art ищет 3D-дженералиста для создания шортсов о боевых искусствах
Как Claude Fable 5 опровергла гипотезу Якобиана и почему это не делает ИИ математиком