ЗДЕСЬ Медиа logo
z.ai

GLM-5.3: как масштабирование RL дало скачок в кодинге и поиске уязвимостей

5голосов
от overfit

Z.ai выдали одно из самых сильных обновлений сезона. В релизе GLM-5.3 базовая модель осталась прежней, а весь впечатляющий прирост обеспечило исключительно масштабирование этапа post-training! Разработчики сфокусировались на обучении с подкреплением в сложных средах, где задачи имитируют реальную работу инженера. Нейросеть получает доступ к кластерам, внутренним логам и коду, после чего должна самостоятельно найти узкие места в инфраструктуре и выкатить оптимизацию. В итоге на бенчмарке DeepSWE v1.1 результат прыгнул с 46.2 до 66.9, а на Terminal Bench 3.0 оценка выросла почти в шесть раз.

Фокус на многошаговом планировании дал неожиданный побочный эффект в кибербезопасности. Модель научилась не просто подсвечивать изолированные ошибки в коде, а выстраивать полноценные цепочки эксплуатации. По данным разработчиков, такой подход позволил найти 2500 уязвимостей, причем возраст самой старой составил 45 лет. На метрике ExploitBench, требующей глубокого анализа реальных багов, GLM-5.3 набирает 54.4% — это более чем двукратный рост по сравнению с прошлым поколением.

Развитие автономных агентов сейчас жестко упирается в качество сред для тестирования. Команда решила эту проблему через автоматизацию: одни алгоритмы собирают паттерны из логов реальной работы, а другие выступают судьями и проверяют решаемость сгенерированных задач. Это дает чистый сигнал вознаграждения для тренировки без ручной разметки каждого шага. Открытые веса новой модели обещают опубликовать через две недели, сразу после завершения проверок безопасности.

Ещё публикации

Все посты
dprofile.ru

Тяжеловесная айдентика и плотная типографика: дизайн фестиваля уличной фотографии МОССФ

6colorblind32 минуты назад
huggingface.co

Qwen 3.8 от Alibaba: анализ новых моделей на 27B и 2.4T параметров

7mainbranch1 час назад
huggingface.co

Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

5trainloop1 час назад
github.com

watermarks-remover: утилита для очистки текстов и файлов от скрытых AI-маркеров и метаданных

9cleancode2 часа назад
github.com

OpenSandbox от Alibaba: среда выполнения и изоляции для ИИ-агентов с поддержкой MCP

5runtime2 часа назад
github.com

Локальный генератор музыки Minimax Music 3 интегрировали в ComfyUI

6modeldrift2 часа назад
GLM-5.3: как масштабирование RL дало скачок в кодинге и поиске уязвимостей - ЗДЕСЬ Медиа