21 августа 2026 года Microsoft подтвердила, что в её дата-центрах появились первые серийные стойки NVIDIA Vera Rubin NVL72, а NVIDIA объявила о переходе платформы в полное производство. Поколение Rubin переходит из лабораторной валидации в массовые поставки гиперскейлерам, и заявленные вендором цифры — вчетверо меньшая потребность в GPU для обучения 10-трлн MoE-моделей и примерно в 10 раз более дешёвый токен инференса — впервые получают реальный производственный фундамент.
Что произошло
21 августа 2026 года генеральный директор Microsoft Сатья Наделла опубликовал в X фотографии поставки с подписью «Delivery day at our Microsoft DCs as the first production Vera Rubins arrive», подтвердив, что первые серийные стойки Vera Rubin NVL72 прибыли в дата-центры компании. В тот же день официальный аккаунт NVIDIA сообщил, что платформа Vera Rubin «ramping into full production». Microsoft/Azure стала первым гиперскейлером, который принимает серийные стойки нового поколения.
Контекст
Vera Rubin NVL72 — следующее после Blackwell стоечное семейство ИИ-компьютеров NVIDIA. В одной стойке размещаются 72 GPU Rubin с памятью HBM4 (50 PFLOPS в формате NVFP4), 36 процессоров Vera на ядрах Arm, коммутатор NVLink 6 с пропускной способностью 3,6 ТБ/с на каждое GPU, сетевые карты ConnectX-9 и DPU BlueField-4; платформа объединяет шесть чипов, включая Spectrum-6 SPX. Стойка полностью на жидкостном охлаждении, лотки модульные и без кабелей, а время установки, по заявлению Nvidia, сокращено до 5 минут против двух часов. До этой поставки Vera Rubin существовала в режиме лабораторной валидации: в марте 2026 года на GTC Microsoft первой включила NVL72 в собственной лаборатории. По планам, объявленным на GTC 2026, после Microsoft последуют Google Cloud и Lambda во втором полугодии 2026 года, AWS, которая развернёт более 1 млн GPU, включая Rubin, в течение 12 месяцев, и neocloud-кластеры, среди которых 1,35 ГВт кластер Nscale для Microsoft.
Почему это важно для индустрии
Переход Vera Rubin из лаборатории в серийные поставки задаёт экономический ориентир для всей индустрии. По данным Nvidia, относительно GB200 NVL72 обучение MoE-модели на 10 трлн параметров требует в 4 раза меньше GPU — 100 трлн токенов за месяц, — а стоимость миллиона токенов инференса на агентных задачах падает примерно в 10 раз; замер выполнен на Kimi-K2-Thinking при 32K/8K ISL/OSL. Это бьёт в ключевую проблему агентного ИИ: агентные сценарии потребляют до 15 раз больше токенов, чем традиционные приложения, и именно стоимость токена ограничивает их экономику. Во втором полугодии 2026 года с приходом Rubin в Google Cloud, Lambda и AWS начнётся ценовая конкуренция за агентный инференс, а закупочные планы гиперскейлеров и neoclouds уже строятся вокруг этой платформы.
Почему это важно для пользователей
Новое GPU-поколение начинает реально работать в облаках, а не оставаться презентационным материалом. Инженерам и операторам инфраструктуры стоит учитывать, что модульные безкабельные лотки и установка стойки за 5 минут ускоряют смену поколений GPU в дата-центрах. Тем, кто следит за ценами на LLM-инференс, ориентир: заявленные примерно в 10 раз более дешёвые токены на Rubin начнут отражаться в облачных ценах с первых гиперскейл-развёртываний во второй половине 2026 года. Прямо сейчас попробовать платформу напрямую нельзя: публичных API и цен на Rubin-инференс ещё нет, доступ появится сначала через Azure, а потом у других облаков, но проектировать агентные воркфлоу, нерентабельные при текущих ценах, уже стоит с прицелом на второе полугодие 2026 года.
Что пока неизвестно / ограничения
Все количественные заявления — вчетверо меньшая потребность в GPU для обучения 10-трлн MoE-модели и примерно в 10 раз более дешёвый токен инференса — это данные вендора: независимых бенчмарков, подтверждающих скачок относительно GB200 NVL72, пока нет. Замер инференса выполнен самой NVIDIA на конкретном сценарии Kimi-K2-Thinking (32K/8K ISL/OSL), а для заявления об обучении не опубликована методология — стратегия параллелизма, utilization, траектория сходимости. Публичные облачные цены на Rubin ещё не появились, поэтому реальный ценовой эффект станет виден только с развёртываний во втором полугодии 2026 года, когда выйдут первые независимые замеры.
Источники
- Сатья Наделла в X: фото поставки первых серийных Vera Rubin в дата-центры Microsoft
- NVIDIA в X: заявление о переходе Vera Rubin в полное производство
- NVIDIA Vera Rubin NVL72 — официальная продуктовая страница
Автор
Look at AI, редакция
