SOURCE // NEWS

英伟达重塑AI工厂经济:算力聚焦Token与能效新标准

英伟达重塑AI工厂经济:算力聚焦Token与能效新标准

人工智能工厂的经济效益,正日益超越单纯对高性能图形处理单元(GPU)的依赖。随着Agent系统需要调用多个模型、数据库和工具,整个数据中心必须作为一个统一的计算系统来运作。

这种转变正将注意力从单个芯片转移到能够将计算能力转化为有用智能的基础设施上。据英伟达超大规模和高性能计算副总裁兼总经理Ian Buck表示,网络、存储、处理器和软件必须大规模协同运行,同时提高每单位功耗的输出效率。

他指出:“现在衡量的是Token,而不是汽车、设备或个人电脑。这些资产不再是IT成本,它们实际上是增值的、能产生收入的、可互换的、耐用的、具有生产力的经济组成部分。”

在这种新范式下,AI工厂的商业产出来自推理过程,即部署的模型处理请求并生成Token。然而,推理并不能取代训练,因为组织需要根据数据和市场条件变化不断更新部署的模型。Buck强调:“这些服务并非一劳永逸。企业在使用这些模型时,会不断对其进行优化、校准并添加更多数据。保持模型更新和感知能力,这本身就是一种训练。我们看到强化学习和在线对齐技术在这方面发挥作用。”

低延迟为那些更快推理具有更高价值的工作负载创造了另一个经济层级。例如,Nvidia Groq 3 LPX推理加速器与Vera Rubin平台协同工作,可提高对时间敏感工作负载(如金融科技领域)的每用户Token速率。“如果这些Token的价值在于尽可能快的思考速度,那么LPX可以在Vera Rubin之上进行加速,以实现这一目标。”

功耗能力最终限制了数据中心可以部署的计算基础设施数量。这一制约使得“每瓦特Token”成为衡量AI工厂经济效益的核心指标,并促使供应商在每一代硬件中提升性能。Nvidia确保每一代GPU的每瓦特Token效率提高10倍以上。事实上,在Blackwell架构中,#Nvidia实现了高达30倍的每瓦特Token改进。

AgentUpdate 深度解析

随着大语言模型(LLMs)驱动的AI Agent日益复杂,它们不再是单点应用,而是需要协调多个模型、知识库和工具的系统。NVIDIA 强调的“Token 经济”和“能效优化”直接击中了 Agent 部署的痛点。未来 Agent 的价值,将不仅体现在其决策能力,更体现在其在给定算力预算下,能产生多少高质量的 Token 输出。这促使开发者在设计 Agent 时,必须深入考虑其 Token 消耗效率和计算路径优化。对比 LangChain 或 CrewAI 等现有 Agent 编排框架,它们虽然提供了构建 Agent 的抽象层,但底层算力效率一直是隐性成本。NVIDIA 的论断,将迫使 Agent 开发者和平台提供商在评估 Agent 性能时,把tokens/watt作为核心指标,推动 Agent 架构向更轻量化、更模块化、更具弹性方向发展。这将催生对优化推理链、工具调用和记忆管理的新一代 Agent 编排技术,最终形成一个更加成熟、更具经济效益的 Agent 生态系统,加速 AI 从工具到智能助手的演进,使得通用型智能体成为可能。