SOURCE // NEWS

微软叫停“Token狂飙”!设置AI预算,GPT-5.6成默认模型

微软叫停“Token狂飙”!设置AI预算,GPT-5.6成默认模型

连科技巨头微软也开始心疼 Token 成本了。据内部邮件透露,微软自今年7月起,正式为各业务部门设置了“AI Token预算目标”。同时,微软已将 GPT-5.6 设置为内部默认模型,原因非常简单:它比其他前沿模型更便宜。微软执行副总裁 Jay Parikh 在内部公开表示:“Token 狂飙(Tokenmaxxing)绝不是我们优化的目标。”

微软的新规主要包含三个方面:第一,设立预算门槛。从2026年7月起,各业务部门都将面临明确的 Token 消费上限;第二,费用透明化,员工现在可以实时查看个人的 AI 消耗,数据显示不少工程师每月会烧掉数百至数千美元;第三,切换默认模型,强制将默认选项降级为更具性价比的 GPT-5.6。Parikh 要求员工像管理其他关键资源一样管理 Token 花费,在享受 GitHub Copilot 带来的效率红利时,必须对成本保持敏感。

这一决策并非空穴来风。微软 CEO 纳德拉(Satya Nadella)此前曾承认自己也是个“Token 狂热者”,沉迷于刷用量,但他随后冷静指出:生产率提升的边际收益必须匹配 Token 的边际成本。并非每个简单任务都需要调用最贵、最强的旗舰模型。然而,微软员工对此怨声载道,有员工一针见血地指出:“如果连托管 AI 算力底座的巨头都玩不起了,普通企业客户又该怎么承受?”

“Tokenmaxxing”(把 Token 用量刷到极致)是过去几个月席卷硅谷的怪现象。一些巨头如 MetaOpenAI亚马逊曾一度将其作为员工绩效的加分项,甚至推出了各种内部“Token 消耗排行榜”。亚马逊曾因员工为了“刷榜”让 AI 执行大量低价值任务而紧急叫停了其 KiroRank 机制;Meta 内部甚至出现了名为 Claudeonomics 的民间争霸赛。英伟达 CEO 黄仁勋也曾推波助澜,公开表示愿意给工程师额外提供相当于一半年薪的 Token 预算。然而,这种疯狂的激励最终催生了巨大的成本泡沫。

各家企业很快发现账单已然失控。调查显示,Atlassian 的月度 AI 开销在一年内激增至原来的三倍,超过 1500万美元Uber 更是在4月份就烧光了全年的 AI 编程预算,被迫对 Cursor 等工具施加每月 1500美元 的人均硬性限制。此外,长期依赖 AI 编程还引发了开发者“编码能力退化”的隐忧,没人能够对成百上千行 AI 生成的代码进行高质量的安全审计。如今,包括 Adobe、花旗银行在内的企业纷纷收紧无限使用权,考核指标也从“消耗了多少 Token”转变为“带来了多少 AI 驱动的实际业务影响力”。

AgentUpdate 深度解析

从“Tokenmaxxing”的狂热退潮到微软等巨头“勒紧裤腰带”,揭示了生成式 AI 落地正在从“幻觉期的效率大跃进”回归到“理性期的 ROI(投资回报率)审视”。在 AI Agent 生态中,这一转变将产生深远影响。首先,它将加速企业从“单体巨型模型”向“小模型路由(Model Routing)”和“端侧轻量化 Agent”过渡,未来的 Agent 架构必须具备成本感知(Cost-Aware)的自适应推理路径选择能力。其次,这也给正在狂飙的 AI 编程工具(如 Cursor、Windsurf)敲响了警钟:单纯依赖大上下文“无脑灌录代码”的粗放模式不可持续,高性价比的混合式检索(RAG)、精准的代码状态机控制以及低成本的 Token 压缩技术,将成为下一代 Agent 框架竞争的核心护城河。AI 生产力的衡量标准,终究要从“Token 消耗速度”回归到“实际业务价值的增量”。