Это самый конкретный документ по безопасности ИИ за последнее время. Пока Белый дом решает не публиковать свой регламент по фронтир-моделям, оставляя странные серые зоны, OpenAI выкатила вторую версию Preparedness Framework. Компания открыто признает проблему: старые методы больше не работают. Раньше модели были просто недостаточно умными для создания глобальных угроз. Теперь на подходе автономные агентные системы, и им требуются совершенно иные механизмы сдерживания.
В тексте дано предельно жесткое определение «тяжелого ущерба» — гибель тысяч людей или экономические потери на сотни миллиардов долларов. OpenAI выделяет три вектора риска, за которыми следит постоянно. Это помощь в создании биологического и химического оружия, автоматизация масштабных кибератак и способность ИИ к самостоятельному улучшению. Третий пункт особенно интересен, так как теперь это измеримая метрика. Если нейросеть начинает слишком эффективно писать код для собственного развития, возникает прямой риск потери контроля над системой.
Заморозкой опасных релизов займется внутренняя комиссия Safety Advisory Group. Если тесты показывают, что модель преодолела порог угрозы, ее выход откладывается до внедрения надежных программных барьеров. Из-за развития логических алгоритмов нейросети умнеют гораздо быстрее, требуя меньше ресурсов на обучение по сравнению с прошлыми поколениями. Поэтому фокус смещается на масштабируемые автоматические оценки возможностей ИИ. Полагаться исключительно на ручную проверку при таких скоростях развития уже бессмысленно!
Поделиться:
Alibaba выпустила Wan-Animate-2: фреймворк для анимации персонажей с текстовым управлением камерой
Критическая угроза или маркетинг: почему OpenAI приостанавливает работу над моделью Astra