AI工厂的存储架构正在被彻底改写。传统的企业存储系统是为相对可预测的工作负载设计的,而人工智能(AI)的出现彻底改变了这一局面。AI工作负载通常在共享基础设施上结合了大量数据移动和频繁的事务性元数据活动,这对现有存储架构构成了巨大挑战。
NetApp 公司正与 Nvidia 公司合作应对这一挑战,双方的合作已超过十年,现在更扩展到围绕AI基础设施的共同工程开发。据#NetApp首席平台与技术官 Arindam Banerjee 介绍,NetApp的 Novus架构 能够将数据和元数据功能分离,使其可以根据不同的工作负载需求独立扩展,同时确保GPU资源能够持续获得数据供应。
Banerjee指出:“不同类型的工作负载,比如处理元数据的事务性工作负载,以及处理检查点(checkpoints)的重度顺序工作负载,现在需要同时进行。过去的架构在处理其中一种方面表现出色,但从未能将两者结合并同时高效处理。这就是AI工厂以及AI工作负载正在推动我们实现的目标:同时处理数据。”
Banerjee与#Nvidia存储技术副总裁 Jason Hardy 在 NetApp INSIGHT 大会上接受了theCUBE的独家采访。他们讨论了AI工厂和AI Agents如何迫使存储系统进行规模扩展并以不同方式运行。
存储架构的这种转变,特别是元数据与数据管理的分离,旨在防止小型事务操作与大型数据传输争夺相同资源。这至关重要,因为存储延迟会导致昂贵的GPU在消耗电源的同时却未被充分利用,从而使效率成为AI规模扩展方程中更重要的一部分,Banerjee解释道。
他补充说:“我们可以在不同的轴向上独立地扩展它们。如果元数据和数据共享相同的资源、相同的介质、相同的网络,就会导致系统效率低下。因为数据操作会被排在元数据操作之后,而元数据操作通常很小且是事务性的。这不仅导致你的GPU利用率不足,它们还在持续耗电。为了恢复效率,最大限度地发挥我们生态系统的潜力,并持续为GPU提供数据,我们必须进行这种架构转变。”
AI基础设施还需要在不迫使企业每次上线新用例时都重新设计系统的情况下进行扩展。Hardy强调,目标是在微调(fine-tuning)、推理(inference)、容量管理以及AI就绪数据方面提供更大的灵活性,以适应生产工作负载的变化以及基础设施不同部分的需求转移。
NetApp与Nvidia在AI存储领域的创新,对于AI Agent生态系统的未来发展影响深远。当前AI Agent在执行复杂任务时,需与多源数据交互,涉及模型调用、上下文管理、记忆检索及实时数据处理。传统存储系统面对Agent高速、并发且混合的数据访问模式时,极易成为性能瓶颈。例如,LangChain等框架中Agent的记忆和工具调用,若底层存储无法高效区分并处理频繁的元数据请求(如检索记忆片段)和大数据流(如加载大型模型权重),其响应速度和扩展性将大打折扣。
相较于向量数据库或传统文件系统等单点方案,Novus架构从底层硬件层面优化了数据流。通过独立扩展元数据和数据路径,它确保了AI Agent在多任务并行时,既能快速决策和状态更新(元数据密集型),又能流畅处理大量数据(数据密集型)。这使得Agent能更高效地进行实时推理、模型微调及与大型数据集的交互,支持更复杂、更自主的Agent行为。在未来的AI Agent发展中,这种高效存储基础将是实现通用智能、提升决策精度和加速学习能力的关键,有望推动Agent从辅助工具向更具通用性、自适应性的智能体进化。



