一天,8 万亿 Token。
这是 DeepSeek V4 Flash 一款模型,在一个 AI 编程工具里的单日用量。开源 AI Agent 工具 OpenCode 发文称,#DeepSeek V4 Flash 正式版通过其平台消耗了 8 万亿 Token。其中,5 万亿来自免费额度,另外 3 万亿来自付费套餐 OpenCode Go。作为对比,大模型路由平台 OpenRouter 接入了 400 多款模型,每月处理约 200 万亿 Token,平均每天约 6.6 万亿。也就是说,DeepSeek 一款模型,仅仅在 OpenCode 一个入口里,一天的消耗量就超过了 #OpenRouter 全平台的日均规模。
这和 DeepSeek V4 Flash 的超低定价直接相关,但更深层的变化在于:人们使用 AI 的方式已经变了。过去,用户向模型问一个问题,得到一段回答即结束任务。现在的 AI Agent 会自己读文件、修改代码、运行程序、检查结果,失败后再重新尝试。一次任务可能持续数小时,调用几十次工具,甚至多 Agent 协同。这种自主迭代让 Token 消耗呈几何级数暴增。例如有人使用 Claude Opus 5 制作一个单页 3D 游戏,由于需要不断生成页面、截图检查、继续修改,最终仅一个 HTML 文件,一句提示词却消耗了 6.9 亿 Token,费用接近 3000 元人民币。
在 Agent 任务爆发的背景下,衡量模型的标准从“单次回答有多聪明”变成了“完成一项长任务要花多少钱、多久、失败几次”。在这套新标准下,DeepSeek V4 Flash 开始成为所有模型的“斩杀线”。一百万个输出 Token,DeepSeek 仅收 2 元人民币(约 0.28 美元)。而 Anthropic 的 Claude Opus 4.8 标准价格是 25 美元(约 170 元),二者相差约 85 倍。
在 Artificial Analysis 的 Intelligence Index v4.1 评测中,V4 Flash Max 得到 50 分,Claude Opus 4.8 Max 得到 56 分。前者跑完整套评测产生的模型调用费约为 72.02 美元,后者则达到 3752.55 美元。Opus 虽然多拿了 6 分,但调用费高出了约 52 倍。这种极端的性价比优势正在改变用户的默认选择。受冲击最深的并非最弱的小模型或最强的旗舰模型,而是处于中间地带的模型:它们比 V4 Flash 稍强,却贵出几十倍,又无法稳定解决 V4 Flash 解决不了的难题。DeepSeek 成功利用近两个数量级的价格差,将这些昂贵的中间大模型挤出了默认调用位。
DeepSeek 能够将“茅台卖出矿泉水价”,核心在于其推理成本控制。V4 Flash 总参数量为 2840 亿,但由于采用了混合注意力结构、低精度权重和针对长上下文的缓存优化,每个 Token 实际仅激活约 130 亿参数。根据技术报告估算,在 100 万 Token 上下文下,V4 Flash 的单 Token 推理计算量仅为 DeepSeek V3.2 的 10%,KV Cache 约为后者的 7%。
在架构层面,V4 系列改造了 Transformer 模块,将注意力层改为先压缩再找重点的 CSA(Compressed Sparse Attention) 机制和更极致压缩的 HCA(Hierarchical Compressed Attention) 机制。同时,前馈层沿用 DeepSeekMoE,包含大量细分专家和少量共享专家,每个 Token 只被路由到一小部分专家。因此,即便是总参数高达 1.6 万亿的 V4 Pro,实际激活也仅有约 490 亿参数。它获得了庞大模型的知识容量,却无需在每次生成时运行全部参数。
随着大模型应用向 AI Agent 范式全面转型,传统的“按次计费”正迅速让位于“按任务ROI”评估。DeepSeek V4 Flash 展现出的百倍性价比,不仅是价格战的产物,更是底层架构创新的必然。其采用的混合注意力(CSA/HCA)与极度稀疏的 MoE 架构,成功解耦了“模型容量”与“推理算力成本”,为 Agent 频繁的“试错-反思-重试”循环提供了能够落地的商业闭环。这标志着 AI 算力消费进入“工业化量产”阶段。对于 Agent 生态而言,这种“斩杀线”迫使竞争对手无法再依靠微弱的性能优势获取高额溢价,推动整个行业从单纯追求参数规模,转向极致的推理架构效率优化。未来,真正能生存下来的 Agent 基础设施,必须在保障基准推理能力的同时,将单次复杂任务的试错成本压低至美分级别。