Z.ai опубликовала 17 сентября 2026 года технический разбор «Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure»: production-инференс модели GLM-5.3-Flash компания собрала с нуля на кластере из более чем 100 000 китайских AI-ускорителей, без NVIDIA. Значительную часть инженерии выполнил Infra Agent на базе самой GLM-5.3, а от первой адаптации модели до production-готовности прошло менее двух недель. До публичного запуска модель анонимно тестировалась на платформах OpenCode и OpenRouter под именем Ox-Alpha.

image

Что произошло

В блоге Z.ai описан запуск production-инференса GLM-5.3-Flash полностью на не-NVIDIA ускорителях и его заявленные результаты: сквозная пропускная способность выросла в три раза, а утилизация железа и стоимость токена, по утверждениям компании, достигли уровня mainstream-карт NVIDIA. Отдельным блоком приведена история анонимного шэдоу-запуска: под именем Ox-Alpha модель за неделю стала самой используемой на OpenCode и OpenRouter, обработав более 62 трлн токенов за 6 дней. Пост перечисляет и конкретные приёмы оптимизации: тензорный параллелизм для linear attention и LM Head, ReplaySSM с обменом вычислений на память, W8A8-квантование, смешанное квантование KV-кэша в INT8, FP8 и BF16, Layer Split и EPD-дизагрегация.

Контекст

Инференс флагманских моделей долгое время был функцией доступа к ускорителям NVIDIA, и именно от этой зависимости Z.ai описывает альтернативный путь. Ключевой механизм в посте — не отдельные оптимизации, а методология «dense feedback»: разреженные end-to-end метрики заменяются локальными, дешёвыми и объективно проверяемыми микробенчмарками, благодаря чему Infra Agent на базе GLM-5.3 мог итерировать оптимизацию serving-стека без полных деплой-циклов. Авторы подают это как шаг к «recursive self-improvement» — петле, где модель улучшает собственную инфраструктуру; в тексте это нарративная рамка поверх инженерных утверждений, которые можно проверять по отдельности. Сам анонимный запуск под нейтральным именем на сторонних платформах — тоже осознанный приём измерения реального спроса без эффекта бренда.

Почему это важно для индустрии

Для отрасли это первый публично описанный случай, когда лаборатория вывела в production инференс флагманской модели на не-NVIDIA ускорителях масштаба свыше 100 000 чипов. Метод «dense feedback» здесь важнее разовой цифры: если петля «агент оптимизирует инфраструктуру через локальные микробенчмарки» воспроизводима, цикл вывода serving-стека в production сжимается с кварталов до недель, и ожидаемы аналогичные публикации и инструменты от других лабораторий. Приёмы вроде W8A8, EPD-дизагрегации и смешанного квантования KV-кэша при подтверждении цифр быстро перетекут в open-source serving-стеки, а в перспективе центр тяжести инференс-экономики смещается от «у кого ускорители» к «у кого качественнее локальные eval-сигналы для агентов», и поставка API диверсифицируется за счёт не-NVIDIA инфраструктур.

Почему это важно для пользователей

Для читателя главное — доступ уже есть: GLM-5.3-Flash работает через OpenRouter и OpenCode с контекстом 1M токенов, а пользователи этих платформ во время анонимной фазы Ox-Alpha фактически обслуживались китайскими ускорителями, не зная об этом. Практически это ещё один конкурент в сегменте дешёвого длинноконтекстного инференса: команды с высокими расходами на длинный контекст могут прогнать свои реальные нагрузки, сравнить стоимость и качество с моделями на NVIDIA и пересчитать unit-экономику продукта. Статья полезна и как редкий публичный разбор того, как LLM-агент выполняет системную инженерную работу над production-стеком. Воспроизвести сам стек пока нельзя: код, конфиги, latency-профили и точный состав ускорителей не раскрыты.

Что пока неизвестно / ограничения

Ключевые цифры — трёхкратный рост пропускной способности, утилизация железа и паритет стоимости токена — являются селф-репортом вендора без раскрытой методологии, и спрос на Ox-Alpha их не верифицирует, поскольку пользователи выбирают модель, а не измеряют утилизацию. Экономическое сравнение не детализировано: в посте нет конкретных карт-конкурентов, описания тестовой нагрузки и учёта TCO. Лидерство Ox-Alpha опирается на стороннюю платформенную статистику, но ссылок на дашборды или снимки данных в посте нет. Наконец, «recursive self-improvement» остаётся рамкой: в тексте показан измеримый инженерный результат, а не доказанная самовоспроизводящаяся петля.

Источники

Автор

Look at AI, редакция