DeepSeek выложила в открытый доступ DeepGEMM-Ascend — порт библиотеки матричных ядер DeepGEMM на NPU Huawei Ascend. Релиз распространяется под лицензией MIT, полностью совместим по API с оригиналом и поддерживает серию Ascend 950, а на чипе Ascend 950DT разработчики заявляют утилизацию железа до 99,8% аппаратного предела при плотном GEMM. Для отрасли это практический шаг к обучению и инференсу моделей DeepSeek вне CUDA-стека NVIDIA.
Что произошло
DeepSeek опубликовала репозиторий DeepGEMM-Ascend — версию библиотеки матричных ядер DeepGEMM, переписанную под NPU Huawei Ascend. Первый релиз датирован 30 сентября 2026 года и поддерживает серию Ascend 950. API полностью совместим с оригиналом: используется тот же пакет deep_gemm, поэтому вызывающий код переписывать не требуется. Ядра переработаны под матричные инструкции Ascend с JIT-компиляцией и конвейеризацией на корутинах. Поддерживаются GEMM в форматах FP4, FP8 и BF16, grouped GEMM для MoE, MQA logits для DeepSeek Lightning Indexer, MegaMoE и HC Prenorm GEMM. На Ascend 950DT с CANN 9.20 плотный GEMM, по данным DeepSeek, достигает 98,3–99,8% аппаратного предела: 1701 TFLOPS в FP4, 861 TFLOPS в FP8 и 431 TFLOPS в BF16. Команда отдельно поблагодарила Huawei за инженерную поддержку.
Контекст
Матричное умножение (GEMM) — базовая операция трансформеров, во многом определяющая скорость обучения и инференса, а экосистема низкоуровневых ядер для неё до недавнего времени существовала фактически только в CUDA-стеке NVIDIA: аналога библиотек класса CUTLASS для других платформ не было, и производительностью вне NVIDIA распоряжался сам вендор. На этом фоне заявленные пики DeepGEMM-Ascend соотносятся как 4:2:1 (1701 к 861 к 431 TFLOPS), что типично для тензорных архитектур и косвенно подкрепляет согласованность самих чисел. Показательно и покрытие: библиотека реализует не абстрактный GEMM, а примитивы реальной архитектуры DeepSeek, то есть рассчитана на сквозное обучение и инференс, а не на синтетические тесты. Отдельную ценность для инженеров представляет публикация самих приёмов оптимизации под новую архитектуру — от sparse data loading до ABI масштабирующих коэффициентов UE8M0: обычно такие детали остаются скрытыми внутри закрытых вендорских стеков.
Почему это важно для индустрии
Для отрасли это первый проверяемый сигнал эрозии CUDA-моата на уровне низкоуровневых матричных ядер: высокопроизводительный матричный слой на NPU Huawei превращается из уникальной особенности железа в заменяемый компонент рабочего стека. Сочетание MIT-лицензии, API-совместимости и того же пакета deep_gemm позволяет командам, уже использующим DeepGEMM, переносить исследовательский код с минимальными правками и сравнивать CUDA- и NPU-реализации на идентичных вызовах. Результат также подтверждает, что Ascend 950 способен работать с FP4 и FP8 на околопиковых нагрузках, и открывает практический путь к обучению и инференсу моделей DeepSeek вне NVIDIA, в перспективе — к инференс-сервисам с dual-вендорным деплоем вокруг MoE-моделей. Для стартапов compute перестаёт быть де-факто эксклюзивом одного вендора, поэтому допущения о стоимости вычислений в финансовых моделях стоит пересмотреть. Если поддержка в CANN закрепится и появятся внешние контрибуции, порт способен вырасти в полноценную экосистему ядер уровня CUTLASS для Ascend.
Почему это важно для пользователей
Код открыт под MIT, поэтому любой инженер может разбираться, как устроены экстремальные оптимизации под чужую архитектуру. Владельцам железа Ascend 950 достаточно CANN 9.20, torch_npu и Python 3.10+, чтобы склонировать репозиторий, собрать бенчмарки из каталога tests/ и проверить заявленные 1701, 861 и 431 TFLOPS на своём железе. Благодаря API-совместимости это дешёвый и честный первый шаг: на текущем этапе уместны бенчмарк и PoC-интеграция, а не запуск в продакшен. Для остальных читателей ценность пока в чтении исходников как исследовательского материала; сообщество вокруг проекта только формируется — на момент публикации в репозитории один коммит.
Что пока неизвестно / ограничения
Ключевые цифры (98,3–99,8% аппаратного пика и заявленные TFLOPS) самодекларированы DeepSeek: независимых замеров пока нет. Околопиковый результат на плотном регулярном GEMM не доказывает зрелость всего компиляторного стека CANN, потому что это структурно самый дружелюбный к оптимизации случай; зрелость стоило бы демонстрировать на неровных формах матриц, grouped-кейсах MoE и сквозных нагрузках, а таких данных в источниках нет. Библиотека закрывает только GEMM-слой: attention, all-reduce и KV-cache остаются за её пределами, поэтому для боевого serving этого пока недостаточно. Репозиторий новый, с единственным коммитом, сообщество только формируется; приживётся ли порт — зависит от дорожной карты Huawei, стабильности CANN и активности сообщества, а экономический эффект — от цены и доступности Ascend 950.
Источники
Автор
Look at AI, редакция
