本周二,谷歌DeepMind正式发布了三款全新的大模型:Gemini 3.6 Flash、3.5 Flash-Lite以及3.5 Flash Cyber。其中,#Gemini 3.6 Flash被谷歌称为“主力工具模型”,旨在提升编程、知识工作和多模态任务的能力,同时其Token消耗量比前代3.5 Flash降低了高达17%,极大地降低了开发者的使用成本。
在另外两款模型中,Gemini 3.5 Flash-Lite是该系列中性价比最高的版本;而Gemini 3.5 Flash Cyber则是针对网络安全领域进行深度微调的专业模型,旨在以合理的成本发现并修复代码中的安全漏洞。谷歌表示,Cyber模型目前仅通过受限访问试点计划,向政府及受信任的合作伙伴开放。
谷歌官方强调,此次发布的重点是为正在大规模构建AI Agent(人工智能体)的客户,提供极具优势的效率、低延迟和可靠性。随着Agent工作流的普及,高频的API调用对底层模型的响应速度和成本提出了极其苛刻的要求。
然而,此次发布会不仅因为谷歌推出了更便宜、更快速的模型而备受关注,更因为其“缺席”的产品而引发讨论。本次更新并未包含行业期待已久的旗舰级模型Gemini 3.5 Pro的升级。该模型的上一次更新还要追溯到今年2月。
在此期间,竞争对手的迭代速度异常迅猛。OpenAI已经发布了GPT-5.5并开始推广GPT-5.6,而Anthropic也推出了Claude Opus 4.8和Claude Sonnet 5,并扩大了其前沿模型Fable 5的访问权限,这让谷歌面临巨大的市场竞争压力。
谷歌曾在今年5月发布3.5 Flash时对Pro版的推出进行过预热,称Pro版本“已经在内部使用,期待下个月推出”。然而,上周彭博社报道称,由于在达到内部设定的性能目标上遇到挑战,谷歌在推出3.5 Pro时面临内部延迟。
通常情况下,Gemini Pro系列代表了谷歌在复杂推理和编程任务上的最高能力水平,而Flash系列则优先考虑生产环境应用中的低成本和快速响应。
谷歌DeepMind产品负责人Logan Kilpatrick在周二表示,团队目前正在与合作伙伴共同测试Gemini 3.5 Pro,并希望它能“很快落地”。他还特别透露,团队已经启动了针对下一代Gemini 4这一最具雄心的预训练阶段。
尽管Anthropic和OpenAI在旗舰级大模型的硬核推理能力上攻势迅猛,但谷歌此次通过极致的Flash产品线,在中端效能和特定垂直领域(如网络安全)筑起了极高的工程性价比壁垒。对于AI Agent生态而言,这标志着技术落地正从“盲目追求极限推理”向“追求极致工程性价比与低延迟”演进。Gemini 3.6 Flash通过减少17%的Token消耗,直接切中了Agent多轮对话和复杂工具流的运营成本痛点。Pro级别的延期,折射出通用前沿模型在Scaling Law(扩展定律)上遇到的边际效应递减瓶颈;而这种“轻量级、高性价比、垂直专用”的Flash模型矩阵,将在未来很长一段时间内成为Agent大规模商业化落地的实际主力军。