今天,谷歌正式发布了两款旨在推动近实时推理能力的新模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。这些模型将使语音Agent更加高效,并让AI对话体验变得前所未有的直观和智能。
Gemini 3.8 Live 主要面向大规模应用和成本效益而设计,它将卓越的对话智能与流畅的交互以及视觉基础能力相结合。它在用户偏好度方面表现出色,在 Speech Agent Arena 中位列第二,同时保持了极高的成本效益,为开发者和企业提供了一个强大且高效的可扩展模型。
对于高复杂度任务,谷歌推出了 Gemini 3.8 Live Extended Thinking。这款模型不仅拥有增强的智能水平,还具备强大的多步推理能力,能够提供企业级的任务完成度。它在 Artificial Analysis' Speech to Speech Quality Index 上以 82.6 分排名第一。在Agentic任务完成方面,它也表现卓越,在 τ-Voice 基准测试中达到 68.6%,在 Sierra’s τ-Voice-banking 基准测试中达到 35.1%。此外,其强大的推理能力在 Big Bench Audio 上获得了 97.7% 的高分,同时价格仍极具竞争力。
对于开发者和企业来说,这些模型提供了构建可靠、生产就绪的语音Agent所需的基础模块。它们还将 Gemini 在 Gemini app、Google Workspace 和 Search 中的语音交互体验变得更加流畅和协作,使用户仅凭声音即可处理复杂的任务。
谷歌 Gemini 3.8 Live 系列的发布,无疑是 AI Agent 生态系统发展中的一个里程碑。与 OpenAI 的 GPT 系列或 Anthropic 的 Claude 等通用型大模型相比,Gemini 3.8 Live 家族更侧重于实时语音交互与多步推理的深度优化。这种专注性使其在特定场景下,尤其是在对延迟和对话流畅度要求极高的语音助理和自动化客服领域,展现出显著优势。例如,其在 Speech to Speech Quality Index 和 τ-Voice 基准测试中的优异表现,直接反映了其在理解复杂语音指令、执行多轮对话和完成复杂任务方面的卓越能力。这对于正在探索 AI Agent 落地应用的开发者而言,提供了一个强大的、开箱即用的底层技术支撑。未来,我们预见这种强调实时、多模态(语音与视觉结合)、多步推理能力的模型,将极大地推动 Agent 框架(如 LangChain 或 CrewAI)向更自然的交互和更复杂的任务自动化方向演进。这意味着 AI Agent 不再仅仅是简单的问答机器,而是能真正理解用户意图、规划行动、甚至主动执行任务的智能伙伴,为 AI Agent 从实验室走向千家万户打下坚实基础,尤其是带动了如虚拟助理、智能家居控制、企业级自动化等领域的革命性发展。此外,Google对成本效益的强调,也将加速这些先进技术的大规模商业化落地。



