近期网络上对 Gemini 的调侃层出不穷,然而就在刚刚,谷歌(#Google)一口气发布了三款新模型,试图用“更高效”、“更聪明”、“为大规模 AI Agent 而生”的实际表现来回应质疑。这三个模型分别是 Gemini 3.6 Flash、3.5 Flash-Lite,以及专攻网络安全的 3.5 Flash Cyber。虽然实际反馈冰火两重天,但在降低 Agent 运行成本上,谷歌确实拿出了看家本领。
作为本次发布的主力,Gemini 3.6 Flash 的核心卖点在于“极度省 Token”。根据第三方评测机构 Artificial Analysis 的数据,3.6 Flash 比上一代 3.5 Flash 节省了 17% 的输出 Token,在代码评估基准 DeepSWE 上甚至能节省高达 65%。这意味着模型在执行多步任务时,推理步数和工具调用更少。同时,价格也迎来下调,输入为 1.5 美元/百万 token,输出则从 9 美元降至 7.5 美元/百万 token,直接压低了单个 Agent 任务的运行成本。
在基准测试方面,3.6 Flash 的代码与操作能力提升显著:DeepSWE 跑分从 37% 升至 49%,更符合生产环境要求;机器学习研究基准 MLE Bench 从 49.7% 提升至 63.9%;计算机操作能力(OSWorld-Verified)也从 78.4% 涨至 83%,且“计算机操作”已成为 #Gemini API 和企业版的内置工具。此外,其知识截止日期终于从 2025 年 1 月更新到了 2026 年 3 月,安全防护能力(Frontier Safety)也同步升级。
定位更低、主打高吞吐低延迟的 3.5 Flash-Lite 同样表现亮眼。它支持灵活调整“推理档位”,速度达到惊人的每秒 350 个 token,价格仅为输入 0.3 美元、输出 2.5 美元 每百万 token。有趣的是,这个“小弟”在一些 Agent 和代码任务(如 SWE-Bench Pro)上甚至反超了 3.0 Flash,成为了更廉价的高效平替。而针对安全领域的 3.5 Flash Cyber 则结合其自研的 CodeMender 工具,专门用于批量查找和修补代码漏洞,目前仅对可信合作伙伴限量开放。
然而,备受期待的旗舰模型 Gemini 3.5 Pro 却依然“跳票”。据媒体爆料,其代码生成能力未能达到谷歌内部预期,甚至可能面临推倒重训。尽管谷歌 AI 宣传负责人 Logan Kilpatrick 试图通过预热“史上最雄心勃勃的 Gemini 4”来转移视线,但这也让外界对谷歌的旗舰进展产生疑虑。第三方评测显示,虽然新发布的 Flash 模型大幅提升了性价比,但 3.6 Flash 在绝对智能水平上,相比 3.5 Flash 几乎原地踏步。
谷歌此次“挤牙膏式”发布,揭示了其在面对 OpenAI 和 Anthropic 旗舰模型竞争时的一种务实策略:在底层基础智能(Raw Intelligence)突破放缓、3.5 Pro 难产的窘境下,转而猛攻“Agent工程化落地”。通过极大压低 Token 消耗与成本、内置“Computer Use(计算机操作)”和可调推理档位(Inference Tiers),谷歌正在为大规模 Multi-Agent 协作扫清最大的财务与效率障碍。横向对比来看,虽然 Gemini 3.6 Flash 的绝对智力并未质跃,但在高并发、多步骤的 Agent 场景中,其高性价比和更低的冗余输出,使其相较于 Claude 3.5 Sonnet 和 GPT-4o 具有极强的工程吸引力。这标志着 AI 竞争正从单纯的“参数与基准霸榜”,演进为“场景落地性价比”的生态卡位战。