SOURCE // NEWS

AI Agent仅用10小时攻破英伟达CUDA?芯片推理战局变天

AI Agent仅用10小时攻破英伟达CUDA?芯片推理战局变天

长期以来,英伟达凭其近二十年铸造的 CUDA 生态在人工智能算力领域构建了牢不可破的壁垒。然而,一家成立仅一年的初创公司 Infinity 正在用 AI 编织的巨网尝试突破这一防线。他们开发的 #AI Agent 在短短 10小时 内,就为芯片初创公司定制开发了一套“类 #CUDA 软件”。与此同时,国内的 DeepSeek 也在通过开源的 TileLang 编写 TileKernels GPU算子库,试图从底层绕过繁重的 CUDA 手写工作,引发了业界对 CUDA 护城河是否松动的深度讨论。

英伟达真正的优势不仅在于 Blackwell 等硬件芯片,更在于围绕硬件建立的庞大软件生态。作为核心的 CUDA 平台可分为三层:底层直接控制芯片的内核与编译器;中层提供高度优化的 cuBLAScuDNN 等计算库及调试工具;顶层则是 PyTorch 等主流开发框架。这套工厂般的软硬一体系统,让开发者在替换非英伟达硬件时将面临极高昂的代码重构成本,构成了强大的用户锁定效应。

此次破局的 AI Agent 名为 Ignition,由谷歌前研究员 Jeremy Nixon 创办。该 Agent 专门针对各种 AI 芯片编写底层软件,具备自主编写底层算子(GPU Kernel)、运行测试、捕捉错误和分析性能的完整闭环。在服务生成式 AI 推理芯片厂商 d-Matrix 时,Ignition 在 10 小时内完成了原本需要多位资深芯片软件工程师耗时数月进行调试的底层适配工作。这证明了在高度结构化且反馈明确的底层编译任务中,AI 自动迭代(写代码-编译-运行-测试-修改)具有颠覆性的高效率。

值得注意的是,这一突破发生的场景是 AI 推理 市场,而非壁垒极高的训练市场。在训练端,大模型需要数万卡协同,对通信、显存调度和集群稳定有极致要求,任何微小的软件损耗都会被无限放大,因此 CUDA 在该领域几乎无可替代。但在推理端,游戏规则变了:相比于追求极致性能,推理更在乎“单次问答的成本”。由于推理任务能拆分到小集群甚至单卡,跨芯片运行的开源软件更容易切入,这给了 RebellionsCerebrasAMD MI300X 以及各大云厂商自研芯片极大的生存空间。

这起“10小时复刻”事件并不是说 CUDA 的繁荣生态能在一夜之间被完全复制,而是表明了非英伟达芯片在推理市场的软件适配成本正在被 AI Agent 呈指数级降低。一旦 d-Matrix 等推理专用芯片通过 AI 工具快速补齐了软件短板,英伟达在推理市场的垄断壁垒将被严重削弱,推理侧的软件竞争将彻底转向开源多样化生态。

AgentUpdate 深度解析

本案例为我们展示了 AI Agent 改变传统芯片与系统软件开发范式的里程碑式成果。在传统硬件行业中,软硬件生态的适配(特别是硬件对应的算子编译器和底层驱动开发)是极其耗费昂贵人力且高度依赖经验的“体力活”。正是因为巨大的软件迁移阻力,英伟达才能用 CUDA 绑定下游开发者。而通过部署专门的 AI Agent(如 Ignition),底层软件栈的研发周期被从“月/年”直接压缩至“小时/天”。这不仅是开发工具的降维打击,更是对芯片半导体行业竞争格局的彻底重塑。随着各类 AI 自动编程 Agent 以及如 #TileLang 等轻量化编程语言的普及,异构计算硬件厂商将能够以极低的边际成本构建专属软件生态,英伟达依靠 CUDA 确立的软件锁定效应将在推理侧逐步走向瓦解。AI 最终依靠自身的演化,凿穿了为其提供算力支撑的巨头护城河,这也是 AI Agent 闭环落地最具启发性的长远影响之一。