Переговоры Anthropic с правительством США: как создательница первых bug bounty оценивает ИИ-уязвимости

В Вашингтоне стартовали переговоры между разработчиками из Anthropic и правительством США. Со стороны ИИ-компании приехала серьезная команда, включая первого автора GPT-3 Тома Брауна и исследователя безопасности Николаса Карлини. Главная интрига разворачивается вокруг еще не опубликованного отчета о джейлбрейках языковых моделей. Детали пока скрыты, но ситуацию уже публично прокомментировала Кэти Муссурис, ознакомившаяся с результатами тестов.
Участие Муссурис в дискуссии о безопасности нейросетей — важнейший маркер для индустрии. Она стояла у истоков современного подхода к поиску багов и сформулировала принципы ответственного раскрытия уязвимостей. Именно она запустила первые программы bug bounty для Microsoft и Министерства обороны США, руководила политикой платформы HackerOne и редактировала международный стандарт ISO/IEC 29147.
Тот факт, что пионер классического хакерского ресерча оценивает уязвимости LLM, фиксирует серьезный сдвиг. Безопасность искусственного интеллекта окончательно перестала быть академической абстракцией! Разработчики переходят к строгим практикам из традиционного infosec, где джейлбрейки — это не просто хитрые промпты, а критические системные баги, требующие стандартизированного аудита.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад