资讯动态

DeepSeek 开源昇腾基础组件:6 个项目分别是什么,怎么用

发布时间:2026/10/1 20:27:34 来源:尧图企业网站定制
发布日期2026-09-30DeepSeek 于 2026 年 9 月 30 日上午通过官方公众号宣布正式开源面向华为昇腾算力平台的基础设施组件涵盖 TileLang 高级语言编译工具、计算库、分布式通信库所有组件都与此前面向英伟达平台的开源组件一一对应。本次开源共涉及 TileLang、DeepGEMM-Ascend、DeepEP-Ascend、TileKernels、FlashMLA、DeepSelect 六个 GitHub 项目覆盖从底层编程语言到矩阵计算、专家并行通信、TopK 算子的完整链路且官方特别提到华为团队在昇腾平台适配过程中给予了大力支持双方已共同推进基于昇腾 950 的 128 卡超节点方案。本文逐一梳理这六个项目各自解决什么问题、核心性能数据以及开发者如何快速上手。这次开源了什么6 个项目对应英伟达平台的完整技术栈DeepSeek 官方强调本次昇腾开源组件与此前面向英伟达 CUDA 平台的开源项目严格一一对应开发者如果熟悉 DeepSeek 在 NVIDIA 平台上的开源生态可以直接按同名概念理解昇腾版本项目定位对应英伟达版本TileLang领域专用语言简化 GPU/NPU 高性能算子开发原生跨平台本次新增昇腾后端DeepGEMM-Ascend矩阵乘法GEMM核心库DeepGEMMDeepEP-Ascend专家并行EP通信库DeepEPTileKernels基于 TileLang 的算子库合集TileKernels原生跨平台新增昇腾支持FlashMLA多头潜在注意力MLA高效算子FlashMLA原生跨平台DeepSelect稀疏注意力 TopK 算子DeepSelect原生跨平台新增昇腾支持需要说明的是其中 TileLang、TileKernels、FlashMLA、DeepSelect 本身是跨平台项目这次更新的是新增了华为昇腾后端支持DeepGEMM-Ascend 和 DeepEP-Ascend 则是专门为昇腾平台新建的独立仓库与 NVIDIA 版 DeepGEMM、DeepEP 完全兼容 API。TileLang比 CUDA 更简单的编程语言这次加了昇腾后端TileLang 是一个面向 GPU/CPU/加速器高性能内核开发的领域专用语言此前已在英伟达平台被 DeepSeek 广泛使用GitHub 上已有超过 7500 颗 Star。2026 年 9 月 30 日的更新为其新增了华为昇腾支持官方说明是沿用 NVIDIA 路径内核现在提供第二个后端运行时自动选择也就是同一套 Python API 可以直接在 NVIDIA GPU 和华为 NPU 上运行不需要开发者重写代码。媒体报道中提到相对英伟达的 CUDA 语言TileLang 的编程更简单能显著提高开发效率、简化代码逻辑同时不损失硬件性能——这正是 TileLang 的设计初衷。DeepGEMM-Ascend矩阵乘法核心库密集 GEMM 利用率达 99.8%DeepGEMM-Ascend 是 DeepGEMM 在华为昇腾平台上的移植版本完全兼容原版 API支持 BF16、FP8、FP4 三种精度的 GEMM 运算以及 MQA logits、MegaMoE 等算子。官方文档给出的实测数据基于昇腾 950DT、CANN 9.20 环境显示密集 GEMMDense GEMM在多种数据类型下利用率最高可达99.8%BF16×BF16M4096/N7168/K16384FP8×FP8 场景下利用率约 99.5%分组 GEMMM-Grouped GEMM用于 DeepSeek MoE 专家计算在 4 组/8 组专家配置下算力利用率普遍在 850 TFLOPS 左右。官方特别提示昇腾平台的缩放因子scaling factor存储格式与 NVIDIA 不同每一对 UE8M0 缩放因子沿 K 维度打包进一个 int16并按 MN-major 顺序存储以适配硬件效率这是移植过程中需要单独处理的硬件差异点。DeepEP-Ascend专家并行通信库dispatch 带宽达物理上限九成以上DeepEP-Ascend 是面向华为昇腾 NPU 的高性能训练与推理通信库提供 MoE dispatch/combine 的专家并行EPall-to-all 通信支持 FP8 dispatch 和延迟 epilogue公开的 buffer API 与 NVIDIA 版 DeepEP 保持一致。底层通过 HCCL/HCOMM、UBMEM 和 URMA 完成通信运行时经由 DeepJIT 编译。在昇腾 950DT、CANN 9.2.0 环境下的实测数据16384 token/rank 容量、隐藏层 7168、256 专家 top-6 路由EP 规模Dispatch 带宽Combine 带宽EP8373–375 GB/s345–347 GB/sEP32335–340 GB/s320–324 GB/sEP128313–320 GB/s272–278 GB/s官方说明在 EP 规模不超过 32 时Dispatch 带宽能达到物理载荷带宽上限的约 90%95%更大规模的 EP 和 Combine 场景仍在持续优化中,涉及本地归约开销和 URMA 的 HBM 争用问题,华为也计划通过固件升级进一步降低这部分争用。TileKernels、FlashMLA、DeepSelect三个跨平台算子库同步支持昇腾TileKernels是基于 TileLang 实现的算子库合集,涵盖混合专家路由、Engram、量化、流形超连接mHC等大模型训练推理中的常见操作本次更新新增了华为昇腾支持,同一套 Python API 可在 NVIDIA GPU 和华为 NPU 间自动切换运行时后端。FlashMLA是多头潜在注意力Multi-head Latent Attention的高效算子实现GitHub Star 数已近 13000是 DeepSeek 开源生态中关注度最高的项目之一同样支持跨平台运行。DeepSelect是专为 DeepSeek 稀疏注意力DSA用于 DeepSeek V3.2、V4、V4.1 等模型和采样器定制的高性能 TopK 算子相比原生torch.topk可实现 2 到 20 倍加速2026 年 9 月 30 日的更新为其发布了华为昇腾版本的 TopK 内核此前已支持 NVIDIA CUDA 平台。开发者怎么上手安装方式与硬件门槛六个项目的安装方式基本遵循 Python 生态的标准流程以 DeepGEMM-Ascend 为例gitclone--recursivehttps://github.com/deepseek-ai/DeepGEMM-Ascend.gitcdDeepGEMM-Ascend pipinstall.--no-build-isolation硬件和软件依赖方面官方文档明确要求华为昇腾 950 系列 NPU部分项目在昇腾 950DT 上验证CANN 9.20 及以上工具链提供bin/bisheng、bin/ld.lldtorch_npu配套包Python 3.10 及以上版本支持 C20format特性的编译器。需要注意的是DeepEP-Ascend 官方文档提到完整满带宽运行还依赖华为 Atlas 850E 的 Q3 商用版 HDK预计 2026 年 10 月中旬左右开放申请当前 README 中的性能数据是基于提供给 DeepSeek 的 PoC 版本 HDK 测得早期版本用户可能观察到带宽低于文档数值这是硬件固件层面的差异不代表软件本身存在问题。常见问题Q这六个项目和 DeepSeek 之前面向英伟达平台的开源项目是什么关系官方明确说明所有昇腾组件与此前面向英伟达平台的开源组件一一对应TileLang、TileKernels、FlashMLA、DeepSelect 是原有跨平台项目新增昇腾后端DeepGEMM-Ascend、DeepEP-Ascend 则是专门为昇腾平台新建、API 与英伟达版本对齐的独立仓库。Q普通开发者没有昇腾硬件还能用上这次开源的成果吗这批组件主要面向有昇腾 NPU 硬件、需要自行训练或部署大模型的团队。如果只是想调用 DeepSeek 系列模型做开发测试不涉及自建训练推理集群也可以直接使用云端已适配好的模型推理服务例如七牛云 AI 大模型广场支持多款主流大模型统一接入按需调用即可不需要关心底层硬件适配细节。Q这次开源和华为昇腾 950 超节点是什么关系DeepSeek 官方在公告中提到,在面向昇腾平台的研发过程中华为团队给予了大力支持双方已共同推进基于昇腾 950 的 128 卡超节点方案,本次开源的六个基础组件尤其是 DeepEP-Ascend 的专家并行通信能力正是支撑这类超节点规模化训练和推理的底层技术基础之一。QDeepGEMM-Ascend 和 DeepEP-Ascend 目前是稳定版本吗从官方仓库信息看两个项目均为 2026 年 9 月刚创建的新仓库,DeepGEMM-Ascend 标注为昇腾 950 系列设备的首次发布DeepEP-Ascend 的 Bucket 集合通信、专家负载均衡等部分能力仍在持续开发中建议关注官方仓库的后续更新再评估是否用于生产环境。结语DeepSeek 这次开源的六个昇腾基础组件覆盖了从编程语言、矩阵计算、通信库到具体算子的完整技术栈且严格对标此前英伟达平台的开源生态降低了开发者在两种硬件路径之间迁移的学习成本。六个项目目前都处于活跃更新阶段部分能力仍在完善中具体适用范围和性能表现建议以各项目 GitHub 仓库的最新 README 为准。本文内容以 DeepSeek 官方公众号公告、各项目 GitHub 仓库文档及 2026 年 9 月 30 日公开报道为准。参考资料TileLang GitHub 仓库github.com/tile-ai/tilelangDeepGEMM-Ascend GitHub 仓库github.com/deepseek-ai/DeepGEMM-AscendDeepEP-Ascend GitHub 仓库github.com/deepseek-ai/DeepEP-AscendTileKernels GitHub 仓库github.com/deepseek-ai/TileKernelsFlashMLA GitHub 仓库github.com/deepseek-ai/FlashMLADeepSelect GitHub 仓库github.com/deepseek-ai/DeepSelect七牛云 AI 大模型广场https://www.qiniu.com/ai/models

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑