SOURCE // NEWS

百度文心助手Agent登顶PinchBench:超越GPT与Claude

百度文心助手Agent登顶PinchBench:超越GPT与Claude

2026年7月17日,百度文心助手任务Agent以最高分 94.6%、平均分 94.4% 的优异成绩,荣登全球工程向 AI 智能体权威评测榜单 PinchBench v2 榜首,成为首个以正式产品身份夺冠的国产智能体系统。在 59 个参评模型中,文心助手成功超越了包括 Claude Opus 4.8(90.5%)和 GPT-5.6-luna(88.7%)在内的全球顶尖模型。

与传统的 MMLU 或 GPQA 基准不同,由 OpenClaw 社区维护的 #PinchBench 重点考核的是智能体的实际执行力——即“能否完整交付可验证的结果”。该评测涵盖了数据分析、代码开发、办公自动化等 7 大类别、147 项真实任务,采用“自动化校验 + LLM 评审”的双轨机制,全程零人工干预,极难进行针对性作弊。百度已将该评测的完整流程和交付物在 GitHub 开源,以供业界复现。

在实际场景测试中,文心助手展现出极高的端到端解决能力。例如在财务分析任务中,它能自主检索财务报告并精准计算出超出指引约 500 个基点 的实际利润率;在网络安全领域,它能够对 Node.js 应用的 CVE 漏洞进行分级并输出精密的修复计划;面对复杂的合同法律文件,它能精准识别多达 20 余项潜在风险,并在各项自动化评分中斩获满分。

除了专业领域的表现,文心助手任务 Agent 同样在日常办公中展现出强大的自主链式任务处理能力。无论是自动合并表格并生成可视化图表,还是根据极简指令生成定制化的旅游攻略,亦或是通过设置定时任务定期自动化输出投研报告,用户无需实时在场,智能体均能高效跑通全流程。

这一技术突破的背后是百度在搜索技术领域沉淀二十余年的意图理解与工程架构实力。该系统依托百度搜索猎户座 AI 引擎的多智能体框架构建,将搜索引擎天然的“意图-拆解-调用-验证”闭环发挥到了极致。这一结果证明,在 Agent 时代,框架工程能力 往往比单纯堆砌模型参数更能决定最终的业务效果。

AgentUpdate 深度解析

百度文心助手此次登顶 PinchBench v2,不仅是国产 AI 模型的胜利,更是“模型+系统工程”协同演进的里程碑。横向对比来看,虽然目前全球市场上有 CrewAI 或 LangChain 等先进的 Agent 编排框架,但百度将搜索引擎级的“猎户座 AI 引擎”注入 Agent,真正打破了“大模型动嘴、人类动手”的瓶颈。这种高度集成的任务级智能体,预示着 AI 生态正在从单纯的“提示词工程”跨入“系统级流控制”阶段。长远来看,这会极大加速企业级 Agent 落地:未来竞争的胜负手将不再完全取决于底层基础大模型(LLM)的参数级别,而是取决于框架层对复杂工具链的调用、纠错和意图拆解的工程深度。百度的成功证明了,搜索技术积淀是打通 Agent 落地最后一公里的关键地基。