Z.ai представила GLM 5.3 — модель на 743 млрд параметров с тем же размером архитектуры, что и GLM 5.2, но с масштабированным пост-тренингом через reinforcement learning на реальных многоэтапных задачах. Прирост производительности достигнут исключительно за счёт RL: рост с 4.6 до 28.3 на Terminal Bench 3.0, улучшение до 66.9 на DeepSWE v1.1, а также непредвиденное появление кибервозможностей — модель нашла 2 436 уязвимостей в 269 проектах с открытым кодом.


Что произошло
Z.ai выпустила GLM 5.3. Архитектура и количество параметров остались неизменными — 743 млрд, как у GLM 5.2. Весь прирост получен за счёт масштабированного post-training через reinforcement learning на реальных длинногоризонтных задачах: оптимизация ML-инфраструктуры, работа с кластерами, отладка в терминале. Результаты на бенчмарках: Z.ai Code Bench показал рост на 50%, Terminal Bench 3.0 вырос с 4.6 до 28.3, DeepSWE v1.1 — с 46.2 до 66.9. Моделирование выявило эмерджентные кибервозможности, не бывшие явной целью тренировки: модель обнаружила 2 436 уязвимостей в 269 проектах с открытым кодом, включая Linux-ядро и WebKit, из них 1 097 среднего и высокого уровня — самая старая уязвимость датируется 1981 годом. Веса модели будут открыты примерно через 2 недели после прохождения проверки безопасности. API-интерфейс изменён: теперь доступны три уровня размышлений — low, high, max — и отключить thinking невозможно, что представляет breaking change для legacy-приложений.
Контекст
Обновление модели происходило без изменения архитектуры и без дополнительного дообучения на новых данных — весь прогресс получен исключительно через RL на реальных, а не синтетических задачах. Шестикратный скачок на Terminal Bench 3.0 указывает на качественный переход от эпизодических успехов к системной способности взаимодействовать с терминалом. Эмерджентные кибервозможности — побочный продукт RL на длинных горизонтах с доступом к реальным системам, что подтверждает гипотезу о том, что масштабный RL-тренинг развивает обобщённые способности к анализу и исследованию. Задержка открытия весов на 2 недели из-за безопасности — сигнал, что индустрия осознаёт риски неконтролируемого доступа к моделям, способным планировать полные цепочки эксплуатации уязвимостей.
Почему это важно для индустрии
Z.ai демонстрирует, что масштабирование RL-пост-тренинга на реальных многоэтапных задачах даёт прорывные результаты, превосходящие подход с синтетическими бенчмарками. Если результаты воспроизводятся, RL на длинных горизонтах станет стандартным этапом post-training для coding моделей, и отрасль перейдёт от демонстрационных метрик к оценке на production-relevant workload. 2 436 обнаруженных уязвимостей в OSS-проектах показывают, что модели с RL-пост-тренингом могут стать новым классом инструментов кибербезопасности. Для стартапов открывается окно для продуктов на стыке devtools и cybersecurity. Обязательный thinking с уровнями глубины может стать отраслевым UX-паттерном.
Почему это важно для пользователей
GLM 5.3 доступен через Z.ai API прямо сейчас — можно начинать тестирование агентов-кодеров и инструментов кибербезопасности. Breaking change с обязательным thinking потребует рефакторинга интеграций: все клиенты получат повышенную латентность и стоимость запросов. Без публичных данных о pricing и latency невозможно рассчитать итоговую стоимость миграции, поэтому рекомендуется тестирование на staging-среде с замером реальных метрик перед deploy в production. Веса будут открыты через ~2 недели — после этого появится возможность self-hosting модели и появления экосистемы open-source инструментов. Модель способна самостоятельно выполнять многодневные задачи по оптимизации ML-кластеров и отладке в терминале.
Что пока неизвестно / ограничения
Отсутствуют публичные данные о reward functions и sample budget, использованных для RL-пост-тренинга Z.ai, что делает попытки воспроизведения методологии преждевременными. Нет информации о pricing и latency API — ранняя интеграция в production без этих метрик является спекулятивной. Нет разбивки результатов DeepSWE v1.1 по категориям задач, из-за чего картина неполная. Заявленная доступность API «прямо сейчас» не гарантирует production-readiness — требуется независимая валидация на реальных workload.
Источники
- GLM-5.3: Frontier Coding with Emergent Cyber Capabilities — официальный блог Z.ai
- Z.ai Launches GLM 5.3 — Unite AI
- GLM-5.3 — Benchmarks, Specs & Release Date — AI Release Tracker
Автор
Look at AI, редакция
