一句话结论
DeepSeek 开源昇腾平台全套基础设施组件,为国产算力中心提供高效易用的软件栈,显著降低国产芯片适配门槛。
关键要点
- 本次开源组件包括 DeepGEMM、FlashMLA、TileKernel、DeepSelect 等高性能算子库和 DeepEP 分布式通信库,与此前面向 GPU 平台开源的组件一一对应。
- 华为昇腾提供稳定的 Ascend C API 接口和 PTO ISA 底层指令体系,支持 TileLang 高级语言编译对接,兼顾不同开发范式。
- 基于华为联合定义的昇腾超节点 SuperPoD Flex 和 UBL128 组网方案,可实现 128 卡 3.2Tbps 单层交换 Scale-up 网络和 256K 卡两层交换 Scale-out 网络,支持超低时延推理和前沿基座模型大规模训练。
- DeepEP 通信库互联带宽实测达到 Dispatch 375 GB/s、Combine 347 GB/s,接近硬件上限,为更大模型向更大集群扩展提供支持。
- 面向大规模推理场景,基于 EP32 部署策略,offline 推理模式下 DeepSeek-V4.1-Flash 不带框架纯模型性能可实现 TPOT=5ms 时每卡输出吞吐 2469 tokens/s,TPOT=10ms 时每卡输出吞吐 5102 tokens/s。
背景与事实
9月 30 日,DeepSeek 正式开源面向昇腾算力平台的基础设施组件。此次开源涵盖 TileLang 高级语言编译工具、高性能计算库与分布式通信库,与此前面向 GPU 平台开源的组件一一对应。DeepSeek 团队向华为昇腾平台开源发布基础设施加速库,对中国 AI 软件生态具有里程碑意义,为算力平台提供了新的选择。
DeepSeek 发布了 DeepGEMM、FlashMLA、TileKernel、DeepSelect 等高性能昇腾算子库组件和 DeepEP 分布式通信库。昇腾提供稳定、开放的 Ascend C API 接口,使用户可对访存路径及计算流水线进行深度调优,完成高性能算子开发。同时,昇腾生态依托开放 Ascend C 编程接口与 PTO ISA 底层指令体系,支持了 DeepSeek 的 TileLang 编程开源工作,兼顾不同开发范式,既支持资深开发者进行精细的手工调优,也支持 TileLang 等高级语言的编译对接。
华为向 DeepSeek 团队提供了联合定义的昇腾超节点 SuperPoD Flex 和 UBL128 组网方案。该方案可实现 128 卡 3.2Tbps 单层交换 Scale-up 网络和 256K 卡两层交换 Scale-out 网络,可支持超低时延推理和前沿基座模型的大规模训练需求。基于全互联的 UBL128 超节点,昇腾提供 ASC-COMM 高性能自定义通信编程库,支撑用户通信算子与通算融合算子高性能编程。DeepSeek 团队开发了高性能 DeepEP 通信库,涵盖 EP / CP / PP / FSDP 等模式下的通信算子,互联带宽实测达到 Dispatch 375 GB/s、Combine 347 GB/s 的通信性能,接近硬件上限。
为支持广泛的开发者基于昇腾 950 及超节点集群部署 DeepSeek 模型,华为将此次联合创新的成果在 CANN 社区开源。开源内容包括大 EP 低延时推理部署、单卡/单机部署、大规模训练、超长文本 KVcache 池化与 Agentic RL 等场景的参考实践和技术报告。
影响分析
对于中文开发者与从业者而言,此次开源带来了多重实质性利好。一方面,DeepSeek 组件与昇腾平台的深度适配,意味着国产算力芯片在实际生产环境中的可用性与性能表现得到验证,降低了企业在国产算力中心部署大模型的技术风险与适配成本。开发者可直接参考 CANN 社区开源的 EP32 部署策略、低时延推理优化及 Agentic RL 训练实践,无需从零开始摸索芯片底层接口。
另一方面,TileLang 高级语言编译工具与 Ascend C API 接口的结合,为不同水平的开发者提供了分层适配路径。资深工程师可基于 Ascend C 接口进行精细算子调优,而普通开发者可通过 TileLang 高级语言快速完成编译对接,显著降低了国产芯片算子开发门槛。对于采用国产算力中心的大模型团队,DeepEP 通信库接近硬件上限的实测带宽性能,为更大规模集群扩展提供了可量化的性能预期。
适用边界
上述推理性能数据基于 Offline 推理模式采集,不包含 Serving 调度和框架负载均衡影响,因此在在线服务场景中实际吞吐与时延指标可能会有所不同。此外,性能数据针对的是 DeepSeek-V4.1-Flash 模型在特定 EP32 部署策略下的表现,其他模型或不同并行策略下性能表现可能存在差异。昇腾 950 及超节点集群的硬件环境为特定条件,在其他硬件配置或集群规模下,上述优化方案的性能表现需重新验证。
孤本观察
本次开源是国产芯片软件生态从“能用”向“好用”转变的标志性事件,DeepSeek 团队选择将基础设施组件与昇腾平台深度绑定并公开全部技术细节,表明国产算力中心已具备支撑前沿模型全链路(从预训练到低精度量化微调再到 Agentic RL)的完整能力,软件生态成熟度正进入新阶段。
常见问题
DeepSeek 此次开源了哪些昇腾平台的基础组件?
包括 DeepGEMM、FlashMLA、TileKernel、DeepSelect 等高性能算子库和 DeepEP 分布式通信库,以及 TileLang 高级语言编译工具。
DeepEP 通信库的实测互联带宽是多少?
Dispatch 带宽实测达到 375 GB/s,Combine 带宽实测达到 347 GB/s,接近硬件上限。
昇腾超节点 SuperPoD Flex 支持的网络规模和带宽是多少?
可实现 128 卡 3.2Tbps 单层交换 Scale-up 网络和 256K 卡两层交换 Scale-out 网络。
DeepSeek-V4.1-Flash 在 EP32 部署下的离线推理吞吐数据是多少?
TPOT=5ms 时每卡输出吞吐 2469 tokens/s,TPOT=10ms 时每卡输出吞吐 5102 tokens/s。
文中提到的推理性能数据存在哪些适用限制?
数据基于 Offline 模式,不含 Serving 调度影响;仅针对 DeepSeek-V4.1-Flash 在 EP32 策略下的表现;其他模型、策略或硬件环境需重新验证。
来源:量子位