OpenAI впервые опубликовала результаты тестов Jalapeño — своего первого кастомного чипа (ASIC) для инференса, созданного совместно с Broadcom. На конференции Hot Chips компания заявила, что в бенчмарке InferenceX от SemiAnalysis чип обходит суперчипы NVIDIA GB200/GB300 по энергоэффективности и end-to-end задержке. Цифры пока без независимого подтверждения, поэтому это заявка производителя, а не доказанный результат.

image
image

Что произошло

25 августа 2026 года на конференции Hot Chips OpenAI представила измеримые результаты Jalapeño — заказной микросхемы (ASIC) для инференса, то есть для выполнения уже обученных моделей. Чип разрабатывался совместно с Broadcom и был впервые показан в июне 2026 года. По бенчмарку InferenceX от SemiAnalysis на моделях GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T Jalapeño выдал в 1,5–1,9 раза больше работы ИИ на ватт и в 1,7–3,6 раза меньшую end-to-end задержку, чем лучшие ранее зафиксированные результаты на суперчипах NVIDIA GB200/GB300. TDP чипа составляет около 700 Вт — примерно вдвое меньше, чем у флагманской системы NVIDIA. Развёртывание малыми партиями запланировано на конец 2026 года, наращивание объёмов — на 2027-й; второе и третье поколения чипа уже в разработке.

Контекст

Инференс, то есть обслуживание уже обученных моделей, — самое дорогое место экономики ИИ: себестоимость каждого запроса определяется ценой за токен и задержкой. Jalapeño — первый inference-ASIC от разработчика frontier-моделей, прошедший Hot Chips и замеренный по сторонней методологии: InferenceX разработан SemiAnalysis, что повышает доверие к цифрам по сравнению с обычными заявлениями производителя. Важный контекст — отношения с NVIDIA: компания недавно согласилась предоставить OpenAI до $105 млрд финансирования под дата-центры, а OpenAI подчёркивает, что не собирается полностью отказываться от GPU партнёров. Jalapeño дополняет существующую GPU-инфраструктуру, а не заменяет её, и это шаг к вертикальной интеграции OpenAI в инференс-железо. Дополнительно: тесты проходили не только на моделях OpenAI, но и на открытых моделях других разработчиков, что показывает — ASIC не привязан к проприетарному стеку.

Почему это важно для индустрии

Если заявленные в InferenceX цифры подтвердятся, себестоимость инференса у OpenAI снизится, что напрямую укрепит маржу компании и её ценовую позицию против конкурентов API, а также переговорную позицию против NVIDIA. Для всей отрасли это сильный сигнальный результат: модель «ASIC для инференса + GPU для обучения» может стать отраслевым стандартом, после чего другие крупные лаборатории последуют за OpenAI со своими кастомными чипами. Эффект уже проявляется на уровне ожиданий: нарратив о дешевеющем инференсе закрепляется, и давление на ценообразование API начинается раньше, чем чип выйдет в масштаб. К 2027 году, с наращиванием объёмов и выходом Gen 2, доля NVIDIA в inference-нагрузках может заметно сократиться.

Почему это важно для пользователей

Сейчас интегрировать нечего: новых публичных возможностей, цен и API под чип нет, а в продакшене Jalapeño пока нет, поэтому для конечных пользователей это заявка производителя, а не подтверждённый факт. В перспективе именно это железо будет отвечать на запросы в ChatGPT и OpenAI API: ожидается снижение задержек, более отзывчивые агенты и голосовые режимы. Когда начнётся развёртывание, первыми эффект увидят внутренние сценарии OpenAI, затем возможны снижение цен API, повышение лимитов и первые данные о реальной задержке. Для разработчиков ценность уже сейчас — в планировании: интерактивные сценарии с низкой задержкой и голосовые режимы, которые раньше были слишком дорогими, могут стать рентабельными в ближайший год-два.

Что пока неизвестно / ограничения

Все цифры заявлены самой OpenAI: компания публиковала результаты самостоятельно, полностью независимых повторных замеров на GB200/GB300 на момент публикации не приведено, а полная методология не раскрыта. Сравнение выполнено с лучшими ранее зафиксированными результатами на GB200/GB300 на момент теста, но конфигурации базовой линии — размер батча, квантование и точность, версия программного стека, топология системы — в источниках не раскрыты, поэтому интерпретировать диапазон 1,7–3,6× по задержке рискованно. TDP около 700 Вт приведён по данным Tom's Hardware, а не по техническому паспорту OpenAI. Публичных цен и API под чип нет, поэтому метрики стоит воспринимать как заявленные производителем, а не доказанные.

Источники

Автор

Look at AI, редакция