💻 DeepSeek перенесла DeepGEMM на Huawei Ascend и выжала 99,8% пика железа

DeepSeek выложила DeepGEMM-Ascend — порт библиотеки матричных ядер DeepGEMM на NPU Huawei Ascend. Первый релиз от 30 сентября 2026 поддерживает серию Ascend 950: GEMM в FP4, FP8 и BF16, grouped GEMM для MoE и MegaMoE. API полностью совместим с оригиналом. На Ascend 950DT (CANN 9.20) плотный GEMM достигает 98,3–99,8% аппаратного предела: FP4 — 1701 TFLOPS, FP8 — 861, BF16 — 431.

🌍 Стек Ascend получил низкоуровневую библиотеку уровня CUTLASS, а Ascend 950 показал околопиковую работу с FP4/FP8. Реальный шаг к обучению и инференсу моделей DeepSeek вне CUDA-стека.

👤 Код открыт под MIT и API-совместим с оригиналом: видно устройство экстремальных оптимизаций — корутины, sparse data loading, ABI UE8M0. Владельцам Ascend 950 нужен лишь CANN 9.20, torch_npu и Python 3.10+ — бенчмарки лежат в tests/.

Источник 1: https://github.com/deepseek-ai/DeepGEMM-Ascend