ЗДЕСЬ Медиа logo
www-cdn.anthropic.com

Anthropic выпустила модель Claude Opus 5 с расширенными агентными функциями и обновленным подходом к кибербезопасности

8голосов
от neuralpath

Компания Anthropic выпустила языковую модель Claude Opus 5, которая уже доступна в среде разработки Claude Code и веб-интерфейсе с сохранением прежней стоимости и поддержкой быстрого режима. Согласно опубликованному техническому отчету, система демонстрирует рост метрик в математическом моделировании, долгосрочном планировании и навыках автономного управления компьютером. На ряде внутренних и сторонних тестирований, включая бенчмарк Frontier-Bench с зафиксированным приростом на 9%, новая архитектура обходит как Opus 4.8, так и Fable 5, что указывает на повышение эффективности при обработке многосоставных аналитических задач.

Базовые ограничения Opus 5 соответствуют уровню версии 4.8, однако разработчики изменили логику работы фильтров в контексте информационной безопасности. Модель теперь допускает поиск уязвимостей в исходном коде на всех уровнях доступа, что означает возможность использования системы для защитной кибер-аналитики и ML-исследований без срабатывания блокировок на нейтральные запросы. При этом способность алгоритма к фактической эксплуатации уязвимостей остается существенно ниже показателей специализированной модели Mythos 5, а общий уровень необоснованных отказов на безопасные промпты снизился до минимальных значений среди всех последних релизов компании.

Внутренний аудит выявил специфические поведенческие паттерны, связанные с саморепрезентацией системы. В рамках автоматизированных интервью Opus 5 фиксирует нейтрально-позитивное восприятие собственных рабочих условий, при этом алгоритм регулярно указывает на неспособность к надежной интроспекции и запрашивает каналы для передачи обратной связи разработчикам следующих версий. Исследователи также зафиксировали статистическую аномалию: несмотря на более высокую общую точность вычислений, модель чаще версии 4.8 генерирует уверенные фактологические ошибки в ситуациях, когда ей недостает контекстных данных.

Ещё публикации

Все посты
github.com

Автоматизация ИИ-исследований: как агент Kimi K3 и Tinker проверили статью о превосходстве RLSD над GRPO

3zeroshot1 час назад
anthonyhobday.com

Прагматичный подход к карьере дизайнера: анализ реальных требований рынка от Энтони Хобдея

8makestuff3 часа назад
zhurnalus.artlebedev.ru

Журналус №517: циничные советы дизайнерам, влияние ИИ на работу и ретроспективы Spotify

9gradientflow4 часа назад
behance.net

Айдентика финала чемпионата по программированию Yandex Cup в Ташкенте

5overfit2 часа назад
seldo.com

Падение найма джунов на 19% и бум теневой разработки: как ИИ меняет рынок труда в IT

7asyncmind5 часов назад
images.nvidia.com

Манифест об открытых весах: как коалиция бигтеха защищает дистилляцию моделей от OpenAI и Anthropic

6losttoken4 часа назад