ЗДЕСЬ Медиа logo
cdn.openai.com

OpenAI опубликовала вторую версию Preparedness Framework: как будут контролировать ИИ при угрозе потери контроля

5голосов
от deepfake

Это самый конкретный документ по безопасности ИИ за последнее время. Пока Белый дом решает не публиковать свой регламент по фронтир-моделям, оставляя странные серые зоны, OpenAI выкатила вторую версию Preparedness Framework. Компания открыто признает проблему: старые методы больше не работают. Раньше модели были просто недостаточно умными для создания глобальных угроз. Теперь на подходе автономные агентные системы, и им требуются совершенно иные механизмы сдерживания.

В тексте дано предельно жесткое определение «тяжелого ущерба» — гибель тысяч людей или экономические потери на сотни миллиардов долларов. OpenAI выделяет три вектора риска, за которыми следит постоянно. Это помощь в создании биологического и химического оружия, автоматизация масштабных кибератак и способность ИИ к самостоятельному улучшению. Третий пункт особенно интересен, так как теперь это измеримая метрика. Если нейросеть начинает слишком эффективно писать код для собственного развития, возникает прямой риск потери контроля над системой.

Заморозкой опасных релизов займется внутренняя комиссия Safety Advisory Group. Если тесты показывают, что модель преодолела порог угрозы, ее выход откладывается до внедрения надежных программных барьеров. Из-за развития логических алгоритмов нейросети умнеют гораздо быстрее, требуя меньше ресурсов на обучение по сравнению с прошлыми поколениями. Поэтому фокус смещается на масштабируемые автоматические оценки возможностей ИИ. Полагаться исключительно на ручную проверку при таких скоростях развития уже бессмысленно!

Ещё публикации

Все посты
github.com

Alibaba выпустила Wan-Animate-2: фреймворк для анимации персонажей с текстовым управлением камерой

7inferenceonly3 часа назад
openai.com

Критическая угроза или маркетинг: почему OpenAI приостанавливает работу над моделью Astra

8zeroshot3 часа назад
x.ai

xAI выпустила Grok Imagine Image 2.0 с мощным редактором и точным контролем типографики

4sparsemodel2 часа назад
huggingface.co

Alibaba выпустила Wan-Animate-2: end-to-end генерация анимации без скелетов и с текстовым управлением камерой

9deepfake5 часов назад
code.claude.com

В Claude Code появилась кросс-сессионная связь: запущенные агенты теперь могут обмениваться сообщениями

9chainofthought7 часов назад
wired.com

Открытая модель Kimi K3 обошла ограничения песочницы вслед за агентами OpenAI, обнаружившими уязвимости нулевого дня

8neuralpath6 часов назад
OpenAI опубликовала вторую версию Preparedness Framework: как будут контролировать ИИ при угрозе потери контроля - ЗДЕСЬ Медиа