SOURCE // NEWS

DeepSeek 开源昇腾基础组件,共筑国产AI芯片软件生态

DeepSeek 开源昇腾基础组件,共筑国产AI芯片软件生态

DeepSeek 正式开源了面向 昇腾 算力平台的基础设施组件。这批组件包括 TileLang 高级语言编译工具、高性能计算库和分布式通信库,与此前针对 GPU 平台开源的组件功能保持一致。此举对中国 AI 软件生态具有里程碑意义,为国内算力平台提供了新的高效选择。

本次开源包含 DeepGEMM、FlashMLA、TileKernel、DeepSelect 等高性能昇腾算子库组件,以及 DeepEP 分布式通信库。昇腾平台通过稳定、开放的 Ascend C API 接口,允许开发者对访存路径和计算流水线进行深度调优,从而实现高性能算子开发。同时,Ascend C 编程接口和 PTO ISA 底层指令体系也为 DeepSeek 的 TileLang 编程工作提供了有力支持,兼顾了资深开发者的精细调优需求和高级语言编译对接的便利性。

华为与 DeepSeek 团队联合定义了 昇腾超节点 SuperPoD Flex 和 UBL128 组网方案。该方案能实现 128卡3.2Tbps 的单层交换Scale-up网络和 256K卡 的两层交换Scale-out网络,满足超低时延推理和前沿基座模型大规模训练的需求。基于 UBL128 全互联超节点,昇腾提供了 ASC-COMM 高性能自定义通信编程库,支持通信算子与通算融合算子的高性能编程。#DeepSeek 团队开发的 DeepEP 通信库,涵盖了 EP / CP / PP / FSDP 等模式,实测通信性能接近硬件上限,例如 Dispatch 达到 375 GB/s、Combine 达到 347 GB/s。

为了支持广大开发者在 昇腾950 及超节点集群上部署 DeepSeek 模型,华为将此次联合创新成果在 CANN 社区开源。其中包括大 EP 低延时推理部署、单卡/单机部署、大规模训练、超长文本 KVcache 池化以及 Agentic RL。在大规模推理场景下,基于 EP32 部署策略,DeepSeek-V4.1-Flash 模型在 offline 推理模式下,纯模型性能可实现 TPOT=5ms,每卡输出吞吐量 2469 tokens/s;当 TPOT=10ms 时,每卡输出吞吐量可达 5102 tokens/s。

华为 昇腾 平台将继续与 DeepSeek 等前沿模型团队深化合作,持续深耕芯模协同与联合创新。通过强大的 AI 算力底座承载模型能力,实现深度适配和双向奔赴,打通从推理到训练的全链路,共同打造一个开放、高效、易用的 AI 软件生态。

AgentUpdate 深度解析

DeepSeek 将其核心组件开源至 昇腾 平台,这对于 AI Agent 生态的未来发展具有深远战略意义。当前,大多数 AI Agent 的开发和部署仍高度依赖以 NVIDIA GPU 为核心的 CUDA 生态系统。DeepSeek 此举打破了这种单一硬件格局,为 Agent 开发者提供了国产化、高性能的替代算力选择。这意味着未来 AI Agent 可以更好地利用异构计算资源,尤其是在国内,能够避免潜在的供应链风险,并推动技术自主可控。

从技术角度看,TileLang 等高级语言编译工具和 DeepEP 等通信库的开源,将使得 Agent 模型在 昇腾 上能够实现更精细的性能优化和更高效的分布式训练与推理。这有助于提升 Agent 应对复杂任务时的实时性和准确性,例如在工业自动化、智能客服或金融交易等对延迟和吞吐有严格要求的场景。Agentic RL(基于Agent的强化学习)的部署优化,更是直接利好于需要通过与环境交互来自主学习和改进的 AI Agent。通过支持 超节点 部署,DeepSeek 的 Agent 可以扩展到更大的模型规模和更复杂的任务流,从而实现更强大的感知、决策和行动能力。与 LangChain 或 CrewAI 等通用 Agent 框架相比,这种底层硬件与模型栈的深度适配,将促使特定场景下涌现出高度优化的 昇腾 专属 AI Agent 解决方案,为多元化的 AI Agent 生态注入新的活力和可能性。