科技圈的动态总是来得猝不及防。近期,AI大模型领域两大顶流几乎同时抛出重磅消息:OpenAI突然宣布其GPT-5.6系列模型价格大幅跳水;与此同时,DeepSeek正式发布了V4-Flash模型,凭借其通过后训练(Post-Training)全面强化的推理和代码能力霸气登场。
过去两年,大模型竞争的主线是追赶能力上限,例如参数量更大、上下文更长、跑分更高。然而,这两份公告共同释放出另一个关键信号:顶级模型的竞争正从单纯的能力比拼,转向争夺「智价比」。这种转变对于AI Agent(人工智能代理)的未来发展尤其重要。
例如,让一个聊天机器人写封邮件,模型通常只调用一次即可完成。但若要让一个代码Agent修复Bug,它可能需要先读取项目文件、搜索代码、应用补丁,再运行测试;一旦测试报错,还需回头检查并重新执行。任务越长,模型调用次数越多,因此其API价格便越直接地影响到Agent能否真正融入日常工作流程。
DeepSeek V4-Flash的API价格仍保持每百万token输入1元、输出2元不变。而OpenAI则将GPT-5.6 Luna的API价格下调约80%,Terra也便宜了20%。这意味着能力持续提升的同时,调用成本却在下降。
DeepSeek此次更新的V4-Flash目前只能通过API使用。开发者调用deepseek-v4-flash时,后台会自动切换至新发布的V4-Flash-0731。它能够一次性读取100万token的内容,非常适合处理大型文档或整个代码项目,并原生支持OpenAI Responses API,可接入类似Codex的工具。值得一提的是,DeepSeek表示,V4-Flash-0731与预览版的模型结构和尺寸完全一致,本次更新仅通过后训练实现了全面强化。这好比模型在完成基础学业后,又进行了大量的专项实践训练,使其更擅长任务拆解、工具选择、错误发现以及端到端完成任务。
官方数据显示,其能力提升幅度巨大,甚至「远超V4-Pro-Preview」。在衡量模型操作终端和连续完成任务能力的Terminal Bench 2.1测试中,分数从61.8分飙升至82.7分;另一项代码Agent测试DeepSWE中,也从7.3分大幅跃升至54.4分。这些数字直观地表明,新版不仅代码能力更强,也更擅长调用工具,从头到尾地完成复杂任务,且价格保持不变。
为了验证V4-Flash的实际能力,我们将其接入Proma,安排了5个从简单到复杂的任务,且在过程中不进行额外提示或干预。测试结果令人惊喜。
首先,我们将爱范儿和APPSO的320篇早报数据交给V4-Flash,要求其分析两个账号的阅读、互动、选题和发布节奏,并生成一份交互式HTML网页报告。V4-Flash不仅用数字卡片交代了整体情况,还将内容细分为账号对比、阅读趋势、互动画像、选题分析、结构透视、爆款榜单和全量明细。报告中巧妙融合了柱状图、折线图、环形图、雷达图和散点图等多种图表,散点图甚至支持切换账号和缩放查看。视觉设计也相当成熟,深色背景与蓝黄色强调色统一,排版清晰,即便图表众多也无拼贴感。
其次,我们布置了更复杂的任务:编写一个包含物理引擎、多种砖块类型与生命值、道具系统(多球、挡板加宽、粘性挡板、激光射击)、以及丰富视觉特效的单文件HTML打砖块小游戏。V4-Flash给出的结果超乎预期:普通砖、金属砖和爆炸砖视觉区分明确;金属砖受击后出现裂纹,爆炸砖能波及周围。各种道具也都能在实际游玩中触发,功能完善。
最后,我们挑战V4-Flash编写一个三体运动轨道交互式模拟器。这类模拟器的核心难点在于精确计算三颗星体的运动轨迹,并让轨道持续运行。V4-Flash交付的页面采用了严谨的四阶龙格-库塔法(RK4)来计算轨道,并加入了引力软化以避免数值爆炸,以及当加速度变大、天体接近时自动拆分计算步长的机制,有效降低了轨迹发散的概率。界面完成度同样出色,主画面留给轨道展示,交互流畅。
DeepSeek V4-Flash的发布,以及与#OpenAI同期降价策略,清晰地描绘了AI大模型竞争进入“智价比”时代的新格局。这对于AI Agent生态而言,无疑是极其积极的信号。以往,构建复杂的多步骤Agent往往受限于高昂的API调用成本和模型在长链推理中的不稳定性。#DeepSeek通过后训练提升模型在任务拆解、工具调用和错误处理上的能力,而非单纯依赖更大的模型尺寸,这是一种高效且成本敏感的优化路径。横向对比来看,Anthropic、Google等也在探索模型优化和成本效率,但DeepSeek此次强调的“智价比”及其在实际Agent任务(如代码Agent DeepSWE)中的显著提升,使其在特定应用场景下具有强大的竞争力。未来,AI Agent将不再是昂贵的实验室玩具,而是能大规模部署到企业流程中,执行如财务数据分析、智能客服、自动化代码审查等任务的实用工具。低成本、高效率的Agent将加速个性化、自动化服务的普及,并促使开发者更加注重Agent框架(如LangChain、CrewAI)与底层模型的深度结合,从而催生出更智能、更自治的Agent系统。这一趋势也将推动模型即服务(MaaS)提供商进一步优化其成本结构和模型性能,最终受益的将是整个AI Agent生态系统和终端用户。