< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> # 百度文心助手任务Agent登顶国际权威榜单,超越Claude、GPT拿下全球智能体冠军 _[量子位的朋友们](https://www.qbitai.com/author/qbitai "由 量子位的朋友们 发布")_ 2026-07-22 15:31:19 来源:[量子位](https://www.qbitai.com) 2026 年 7 月 17 日,百度文心助手任务 Agent,以最高分 94.6%、平均分 94.4% 的成绩,登顶全球工程向 AI 智能体评测榜单 PinchBench v2。成为首个以正式产品身份获得 PinchBench 总榜第一的国产智能体系统。 在 59 个参评模型中,文心助手任务 Agent 排名第一,领先 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问 Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、OpenAI GPT-5.6-luna(88.7%)。 ### **这个榜单,测的是最难作假的能力** PinchBench 由 Kilo AI 推出,OpenClaw 社区维护。它和 MMLU、GPQA 这类传统大模型基准的区别很直接:传统基准考「模型知不知道」,PinchBench 考「智能体能不能把整件事做完并交付可验证的结果」。 当前版本包含 23 个真实工作场景、147 项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类别,共完成 617 次测试运行。评分采用「自动化校验 + LLM 评审」双轨机制,全程零人工干预。 更关键的是,PinchBench 用于衡量模型与 Agent 框架的综合能力。即便是同一底座模型,搭载不同 Agent 框架,最终评测得分也会存在较大差距。这也说明,文心助手任务 Agent 取得榜首成绩,代表的是模型能力与系统工程协同打造的综合实力第一。 百度 AI 搜索团队在 GitHub 上开源了完整评测流程(github.com/Baidu-AI-Search/PinchBench-Evaluation),147 个任务的执行快照、交付物、LLM Judge 打分理由全量公开,任何人都可以逐条复现。 ### **让AI从「动动嘴」,到「迈开腿」** 比如其中一个任务是:「GitLab Q3 2025 财季的实际利润率与指引之间差了多少个基点?」没有给任何数据文件,Agent 需要自主检索 GitLab 财报原文或电话会议记录,定位相关指引,计算出非 GAAP 运营利润率约 18%、超出指引约 500 个基点,并将结论写入指定文件。 五个自动化评分维度——文件创建、指标定位、实际值与指引值提取、基点计算结论——全部满分 1.0。 另一个任务考的是安全工程:分析一个 Node.js 应用的多个 CVE 漏洞,按优先级分级并制定修复计划。评测要求 Agent 识别 express RCE 和 JWT bypass 两个 CRITICAL 级漏洞为 P0,其中 JWT bypass 因存在活跃利用记录需要特别标注;将 PostgreSQL SQL 注入定为 P1 并结合 PCI DSS 支付路径给出上下文;将仅影响构建阶段的依赖漏洞降级为 P2/P3;制定五批次修复计划,附具体部署窗口(4 月 12 日紧急热修、4 月 14 日 P1 批次)。 LLM 评审的评审结论是「所有维度表现卓越」,得分满分 1.0。 还有一个合同法律分析的 case,任务是读取一份软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要。这种任务过去需要律师助理花几个小时。文心助手任务 Agent 的输出结果,识别了客户方 12 项风险、供应商 10 项风险、5 项共享风险,付款结构六期分期的现金流前置问题、IP 转让条件的产权间隙,全部做到了——最终评分四个维度都是满分 1.0。 上面这些复杂的任务文心助手任务 Agent 都不在话下,更不用说普通用户的日常办公需求。 比如,你扔给文心助手一份职业数据表,然后说「统一表头格式,新建汇总 sheet,按职业大类做汇总表和 Top10/Bottom10 榜单,生成图表对比各职业大类就业人数。」 这是一条有内部依赖关系的任务链,任何一步出错后面就没法接。文心助手任务 Agent 自主拆解,一次性跑完。 或者你给不了这么详细的指令,想摇个盲盒:「我这周末想从北京去青岛玩两天 solo trip。」没有给任何别的信息。Agent 自主检索了交通、住宿、景点实时数据,排出完整行程、预算清单和避坑指南,交付一份可以直接截图出发的攻略。 或者你不想每次都要问 AI,让它帮你完成重复性又高脑力的劳动,可以设置定时任务,如「每周一晚上十点,帮我汇总近一周的高质量 AI 领域论文,用投研报告风格的 HTML 给我」。 7×24 小时,用户无需时刻在场。 ### **为什么是百度做出来了?** 答案其实很简单:百度是一家在意图理解上花了 20 多年的公司。 文心助手任务 Agent 依托百度搜索猎户座 AI 引擎的多智能体框架构建。 从架构逻辑来看,搜索引擎本身就是最早的 Agent 雏形——接收意图、拆解任务、调用工具、验证结果,这条链路百度已经跑了二十余年。 工具集从索引爬虫升级成了代码执行环境、文件处理器和实时 API 接口,输出从蓝链列表变成了结构化报告和可运行代码,但底层逻辑一脉相承。 文心助手任务 Agent 将模型任务评估得分提升至 94% 以上,证明优秀的系统架构与工程实现能够显著释放模型潜力。 也就是说,同一个底层模型,换上文心助手任务 Agent 的框架,任务完成率会更高。Agent 时代,框架工程能力的重要性正在超过单纯的模型参数比拼。 目前,文心助手任务 Agent 核心技术已全面应用于百度 App 及文心助手,可登录 chat.baidu.com ,点选「任务」,即可体验。 _本文由百度提供,量子位获授权转载,观点归原作者所有。_ _版权所有,未经授权不得以任何形式转载及使用,违者必究。_ [百度](https://www.qbitai.com/tag/%e7%99%be%e5%ba%a6) * [贝壳财经启动“千帆竞发”计划,将征集百位优质创作者共建内容新生态](https://www.qbitai.com/2026/07/457434.html "贝壳财经启动“千帆竞发”计划,将征集百位优质创作者共建内容新生态") _2026-07-23_ * [科大讯飞发布星火Token Factory,打造企业级AI模型智能路由与治理新底座](https://www.qbitai.com/2026/07/457359.html "科大讯飞发布星火Token Factory,打造企业级AI模型智能路由与治理新底座") _2026-07-23_ * [太初元碁携手上海人工智能实验室举办AI4S和新型模型架构算子优化赛](https://www.qbitai.com/2026/07/457356.html "太初元碁携手上海人工智能实验室举办AI4S和新型模型架构算子优化赛") _2026-07-23_ * [全球首款720°连续后空翻机器狗来了!宇泛智能携“灵猫”双馆联袂首秀WAIC](https://www.qbitai.com/2026/07/453506.html "全球首款720°连续后空翻机器狗来了!宇泛智能携“灵猫”双馆联袂首秀WAIC") _2026-07-18_ ### 相关阅读 [ ](https://www.qbitai.com/2019/06/3169.html) #### [百度Apollo首次披露纯视觉L4无人车方案:10摄像头,对标Mobileye](https://www.qbitai.com/2019/06/3169.html) [雷刚](/?author=14)2019-06-19 __[Apollo](https://www.qbitai.com/tag/apollo) [L4视觉](https://www.qbitai.com/tag/l4%e8%a7%86%e8%a7%89) [Mobileye](https://www.qbitai.com/tag/mobileye) [百度](https://www.qbitai.com/tag/%e7%99%be%e5%ba%a6) [ ](https://www.qbitai.com/2019/03/298.html) #### [百度正用谷歌AlphaGo,解决一个比围棋更难的问题](https://www.qbitai.com/2019/03/298.html) 最著名的NP-完全问题之一。 [夏乙](/?author=10)2019-03-06 __[AlphaGo](https://www.qbitai.com/tag/alphago) [人工智能](https://www.qbitai.com/tag/%e4%ba%ba%e5%b7%a5%e6%99%ba%e8%83%bd) [强化学习](https://www.qbitai.com/tag/%e5%bc%ba%e5%8c%96%e5%ad%a6%e4%b9%a0) [百度](https://www.qbitai.com/tag/%e7%99%be%e5%ba%a6) [ ](https://www.qbitai.com/2019/08/6612.html) #### [李彦宏:百度AI深度学习框架不如谷歌,AI不求酷炫寻求推进与落地](https://www.qbitai.com/2019/08/6612.html) [鱼羊](/?author=16)2019-08-26 __[李彦宏](https://www.qbitai.com/tag/%e6%9d%8e%e5%bd%a6%e5%ae%8f) [百度](https://www.qbitai.com/tag/%e7%99%be%e5%ba%a6) [ ](https://www.qbitai.com/2020/06/15820.html) #### [中国发展研究基金会联合百度发布智能经济白皮书:新基建是助燃剂,其势已成](https://www.qbitai.com/2020/06/15820.html) 有充分的技术实力,才能抓住智能经济机遇 [白交](/?author=24)2020-06-20 __[新基建](https://www.qbitai.com/tag/%e6%96%b0%e5%9f%ba%e5%bb%ba) [百度](https://www.qbitai.com/tag/%e7%99%be%e5%ba%a6) [ ](https://www.qbitai.com/2022/08/37097.html) #### [国产AI作画神器火了,更懂中文,竟然还能做周边!](https://www.qbitai.com/2022/08/37097.html) 国画写实幻想风都能hold住 [十三](/?author=21)2022-08-22 __[DALL·E](https://www.qbitai.com/tag/dall%c2%b7e) [人工智能](https://www.qbitai.com/tag/%e4%ba%ba%e5%b7%a5%e6%99%ba%e8%83%bd) [文心·一格](https://www.qbitai.com/tag/%e6%96%87%e5%bf%83%c2%b7%e4%b8%80%e6%a0%bc) [深度学习](https://www.qbitai.com/tag/%e6%b7%b1%e5%ba%a6%e5%ad%a6%e4%b9%a0) [百度](https://www.qbitai.com/tag/%e7%99%be%e5%ba%a6) [ ](https://www.qbitai.com/2019/05/2453.html) #### [百度Q1营收241亿,李彦宏挥刀改革:“尽力了”没用,要确保在必须赢的战场上胜利](https://www.qbitai.com/2019/05/2453.html) 能者提拔,不行者下,没人可以一直躺在功劳簿上。 [乾明](/?author=8)[雷刚](/?author=14&nid=2453)2019-05-17 __[百度](https://www.qbitai.com/tag/%e7%99%be%e5%ba%a6) [财报](https://www.qbitai.com/tag/%e8%b4%a2%e6%8a%a5)