На конференции Hot Chips 2026 Microsoft публично раскрыла архитектуру Maia 200, второго поколения собственного ИИ-ускорителя для инференса в Azure. Это редкий случай, когда гиперскейлер показывает честные инженерные цифры чипа, а не маркетинговые обещания: в основе дизайна Software Defined Local Access (SDLA), где поток данных фиксируется на этапе компиляции, а связь между тысячами чипов идет по единому Ethernet, а не по отдельному scale-up-интерконнекту.

image

Что произошло

Microsoft представила Maia 200 на Hot Chips 2026 и выложила детальную картину чипа: техпроцесс TSMC 3 нм, 140 млрд транзисторов на кристалле площадью 820 мм², максимальное тепловыделение 750 Вт. Память — шесть стеков HBM3e с суммарной пропускной способностью 7 ТБ/с, пиковая производительность достигает 10 000 TFLOPS в 4-битном формате FP4, созданном для инференса. Архитектурное ядро — Software Defined Local Access: маршрут данных задается софтом и закрепляется на этапе компиляции, а доступ к данным остается локальным внутри вычислительных элементов. Каждый базовый тайл содержит тензорный блок TTU, SIMD-процессор TVP, управляющий блок TCP, DMA-блок и L1-кэш. Масштабирование предусмотрено только в плоскости scale-up и только по единому Ethernet: собственный NIC и протокол, восемь Ethernet-линий на чип, сгруппированные в четыре сетевые плоскости, референсная конфигурация — 128 стоек и 6000 чипов, коллективные операции выполняются через библиотеку MCCL (Microsoft Collective Communication Library). В опубликованных микробенчмарках GEMM работает у теоретического предела (roofline), BF16 AllReduce показывает около 1,3 ТБ/с, All2All — до 655 ГБ/с, а коллективные операции завершаются за один хоп.

Контекст

У облачных провайдеров исторически было два рабочих пути в AI-вычислениях: закупать GPU NVIDIA либо строить полностью кастомные ASIC по образцу TPU. Maia 200 выстроена как третий путь между ними: не универсальный GPU, но и не закрытый исследовательский чип. Ставка сделана именно на инференс, который является главной статькой затрат Azure, и в первую очередь на MoE-модели — разделение prefill и decode, expert parallelism и минимальный трафик памяти решают именно экономику этих нагрузок, поэтому архитектура SDLA удерживает данные в пределах локальных тайлов. Детализация ускорителя на Hot Chips — привычный для индустрии сигнал о подготовке чипа к реальным развертываниям в дата-центрах.

Почему это важно для индустрии

Maia 200 — первый публичный срез архитектуры не-NVIDIA ускорителя гиперскейлера с проверяемыми цифрами, и экосистема может использовать его как референс для калибровки ожиданий от инференс-железа. Отказ от отдельного scale-up-интерконнекта в пользу единой Ethernet-фабрики — смелая архитектурная ставка: если она подтвердится в проде, подход станет образцом для следующего поколения ускорителей, а коллективные коммуникации MCCL на единой фабрике претендуют на статус индустриального стандарта. Конкретные микробенчмарки вместо маркетинговых формулировок «до N TFLOPS» говорят о зрелости со-дизайна компилятора и железа. Если развертывание в Azure начнется, Maia 200 станет прямым конкурентом NVIDIA в инференс-нагрузках облака и фактором давления на цены GPU и требования к их энергоэффективности.

Почему это важно для пользователей

Нового API, модели или сервиса для разработчиков в этом анонсе нет: Maia 200 — внутренняя инфраструктура Azure, без GA, цен и доступа извне. Влияние будет опосредованным: если чип станет хребтом инференса Azure, инференс MoE-моделей может стать дешевле и быстрее, а вместе с ним — и то, на чем в Azure работают Copilot и модели OpenAI. Уже сейчас материал полезен для планирования: анонс корректирует ожидания по стоимости токена и задержкам, и те, кто считает экономику продуктов на инференсе в Azure, могут пересматривать допущения о цене токена на задачу. Для инженеров и исследователей это редкий публичный источник честных цифр по не-NVIDIA ускорителю, который обычно прячется за маркетингом.

Что пока неизвестно / ограничения

В материалах нет стоимости Maia 200, yield и цены за токен, а опубликованы только микробенчмарки: данных об end-to-end производительности полных моделей нет. Надежность и задержки на референсном масштабе в 6000 чипов публично не подтверждены. Даты GA, цены и доступ для сторонних пользователей не объявлены. Прогнозы о ценовом давлении на LLM-инференс и о том, что оптимизации инференса перестают быть конкурентным преимуществом, — бизнес-интерпретация, а не техническое утверждение.

Источники

Автор

Look at AI, редакция