💻 Z.ai собрала production-инференс GLM-5.3-Flash на 100+ тысячах китайских ускорителей

Компания опубликовала статью «Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure»: значительную часть инженерии выполнил Infra Agent на базе GLM-5.3, а от первой адаптации до production-готовности прошло меньше двух недель.

🌍 По данным Z.ai, сквозная пропускная способность выросла в 3 раза, а стоимость токена и утилизация железа вышли на уровень mainstream-карт NVIDIA. Это цифры вендора без независимой проверки, но прецедент: флагманская модель в production на 100k+ не-NVIDIA чипов.

👤 До публичного запуска модель анонимно работала под именем Ox-Alpha на OpenCode и OpenRouter и за неделю стала самой используемой на обеих платформах, обработав более 62 трлн токенов за 6 дней. Не-NVIDIA инфраструктура уже держит реальную production-нагрузку.

Источник 1: https://z.ai/blog/glm-built-its-inference-infrastructure