连科技巨头微软也开始心疼 Token 成本了。据内部邮件透露,微软自今年7月起,正式为各业务部门设置了“AI Token预算目标”。同时,微软已将 GPT-5.6 设置为内部默认模型,原因非常简单:它比其他前沿模型更便宜。微软执行副总裁 Jay Parikh 在内部公开表示:“Token 狂飙(Tokenmaxxing)绝不是我们优化的目标。”
微软的新规主要包含三个方面:第一,设立预算门槛。从2026年7月起,各业务部门都将面临明确的 Token 消费上限;第二,费用透明化,员工现在可以实时查看个人的 AI 消耗,数据显示不少工程师每月会烧掉数百至数千美元;第三,切换默认模型,强制将默认选项降级为更具性价比的 GPT-5.6。Parikh 要求员工像管理其他关键资源一样管理 Token 花费,在享受 GitHub Copilot 带来的效率红利时,必须对成本保持敏感。
这一决策并非空穴来风。微软 CEO 纳德拉(Satya Nadella)此前曾承认自己也是个“Token 狂热者”,沉迷于刷用量,但他随后冷静指出:生产率提升的边际收益必须匹配 Token 的边际成本。并非每个简单任务都需要调用最贵、最强的旗舰模型。然而,微软员工对此怨声载道,有员工一针见血地指出:“如果连托管 AI 算力底座的巨头都玩不起了,普通企业客户又该怎么承受?”
“Tokenmaxxing”(把 Token 用量刷到极致)是过去几个月席卷硅谷的怪现象。一些巨头如 Meta、OpenAI、亚马逊曾一度将其作为员工绩效的加分项,甚至推出了各种内部“Token 消耗排行榜”。亚马逊曾因员工为了“刷榜”让 AI 执行大量低价值任务而紧急叫停了其 KiroRank 机制;Meta 内部甚至出现了名为 Claudeonomics 的民间争霸赛。英伟达 CEO 黄仁勋也曾推波助澜,公开表示愿意给工程师额外提供相当于一半年薪的 Token 预算。然而,这种疯狂的激励最终催生了巨大的成本泡沫。
各家企业很快发现账单已然失控。调查显示,Atlassian 的月度 AI 开销在一年内激增至原来的三倍,超过 1500万美元;Uber 更是在4月份就烧光了全年的 AI 编程预算,被迫对 Cursor 等工具施加每月 1500美元 的人均硬性限制。此外,长期依赖 AI 编程还引发了开发者“编码能力退化”的隐忧,没人能够对成百上千行 AI 生成的代码进行高质量的安全审计。如今,包括 Adobe、花旗银行在内的企业纷纷收紧无限使用权,考核指标也从“消耗了多少 Token”转变为“带来了多少 AI 驱动的实际业务影响力”。
从“Tokenmaxxing”的狂热退潮到微软等巨头“勒紧裤腰带”,揭示了生成式 AI 落地正在从“幻觉期的效率大跃进”回归到“理性期的 ROI(投资回报率)审视”。在 AI Agent 生态中,这一转变将产生深远影响。首先,它将加速企业从“单体巨型模型”向“小模型路由(Model Routing)”和“端侧轻量化 Agent”过渡,未来的 Agent 架构必须具备成本感知(Cost-Aware)的自适应推理路径选择能力。其次,这也给正在狂飙的 AI 编程工具(如 Cursor、Windsurf)敲响了警钟:单纯依赖大上下文“无脑灌录代码”的粗放模式不可持续,高性价比的混合式检索(RAG)、精准的代码状态机控制以及低成本的 Token 压缩技术,将成为下一代 Agent 框架竞争的核心护城河。AI 生产力的衡量标准,终究要从“Token 消耗速度”回归到“实际业务价值的增量”。