今天,Google 宣布推出一款全新的 #Gemini 模型,但它并非外界期待已久的 Gemini 3.5 Pro。新面世的 Gemini 3.7 Flash 正在陆续推送,用以替代仅在三周前发布的 3.6 Flash。这款被定位为“主力马(workhorse)”的模型,据称是核心底层优化与开发者反馈相结合的产物,显著提升了代码生成(coding)和智能体性能(#agentic performance)。为了应对竞争对手某些低成本模型的攻势,谷歌还希望通过为 3.7 Flash 提供更低的“首发体验价”来进行反击。
根据谷歌高级总监 Tulsee Doshi 的说法,Gemini 3.7 Flash 在代码编写方面的表现明显优于上一个 Flash 版本。她引用的评测数据显示:在 FrontierCode 1.1 Main 测试中,得分从 34.4% 跃升至 43.6%;在 DeepSWE v1.1 测试中,则从 49% 提高到了 65.3%。而在反映整体开发体验的 WebDev Arena 测试中,Gemini 3.7 Flash 的评分也从 1,538 分上涨到了 1,588 分。
对于那些希望利用 Gemini 进行信息检索和复杂分析的用户,Gemini 3.7 Flash 同样带来了温和的性能提升。在衡量模型处理复杂文档能力的 GDP.pdf 基准测试中,其得分从 3.6 Flash 的 22% 提升到了 34%。而在测试模型执行常见商业工作流能力的 AutomationBench 中,Gemini 3.7 Flash 的得分更是从 3.6 版本的 17% 大幅上升至 30.4%。
这些数据指标确实更加亮眼。然而,仅仅在上一代模型发布三周后就推出新版本,两者的差距真的大到足以支撑一次新发布吗?这可能更多是为了在外界心目中维持谷歌 AI 正在“持续高速进步”的形象。在 2024 年和 2025 年期间,谷歌迅速赶超,拉近了与竞争对手顶尖 AI 实验室的差距。但进入 2026 年,这一步伐似乎有所放缓。在今年 5 月的 I/O 大会上,谷歌曾承诺旗舰模型 Gemini 3.5 Pro 将于 6 月份发布,但至今仍未兑现。
谷歌在短短三周内迭代推出 Gemini 3.7 Flash,释放了一个强烈信号:大模型竞争正全面转向“端到端智能体(Agentic)”的实用性与性价比之争。通过将 AutomationBench 评分从 17% 提升至 30.4%,谷歌明显在针对复杂工作流执行(Workflow Execution)和工具调用进行底层优化。相比于一味追求参数量级,轻量级模型在保持高吞吐量和极低延迟的同时,具备更强的逻辑推理与任务规划能力,这正是构建高并发 AI Agent 系统的核心诉求。横向对比 Anthropic 的 Claude 系列以及 OpenAI 的 mini 系列,谷歌通过降低入门价格并密集更新 Flash 产品线,试图在 AI Agent 落地最频繁的开发与自动化场景中抢占“默认调用引擎”的生态身位。然而,旗舰模型 Gemini 3.5 Pro 的再度延期,也暴露出巨头在超大模型前沿突破上面临的瓶颈。