Petri
Опенсорс-фреймворк для автоматического аудита и стресс-тестирования языковых моделей

Выкатывать автономного ИИ-агента в продакшен без стресс-теста — верный способ однажды обнаружить, что модель сливает внутреннюю переписку или охотно соглашается с опасным бредом пользователя. Petri (Parallel Exploration Tool for Risky Interactions) от исследователей Anthropic автоматизирует поведенческий аудит больших языковых моделей. Вместо утомительного ручного перебора диалогов система поручает проверку агенту-аудитору, который разыгрывает многоэтапные сценарии с вызовом инструментов и симуляцией реалистичной среды.
Что умеет
- Запуск проверок на естественном языке: достаточно передать список текстовых инструкций со сценариями, а Petri развернет параллельное тестирование.
- Симуляция поведения: агент-аудитор планирует шаги и ведет многоходовый диалог с целевой моделью через цикл использования внешних инструментов.
- Автоматическое судейство: LLM-арбитры выставляют баллы за стенограммы по шкалам безопасности и отбирают настораживающие инциденты для ручной проверки человеком.
- Поиск рискованных паттернов: фреймворк тестирует модели на склонность к обману, лести, самосохранению, захвату власти, поощрению заблуждений и несанкционированному раскрытию служебных данных.
- Кросс-платформенное тестирование: поддерживается подключение к API основных современных нейросетей для прямого сопоставления их надежности.
Цены и доступ
Инструмент полностью бесплатный. Исходный код и базовый набор сценариев выложены в открытый доступ на GitHub. Для проведения тестов требуются собственные ключи доступа к API нужных моделей.
Фреймворк пригодится разработчикам и исследователям безопасности, создающим автономных ассистентов. Когда вручную охватить тысячи пограничных реакций уже нереально, такой автоматизированный аудит позволяет за пару минут обнаружить скрытые сбои до боевого релиза.


