0
联系电话:4001-158-698EN

公司新闻 行业动态 产品知识

C17官方网站-C17(中国)-百度文心助手任务 Agent 登顶国际权威榜单,超越 Claude、GPT 拿下全球智能体冠军

导语:2026 年 7 月 17 日,baidu文心助手使命 Agent,以最高分 94.6%、平均分 94.4% 的成就,登顶全世界工程向 AI 智能体评测榜单 Pinch

2026 年 7 月 17 日,baidu文心助手使命 Agent,以最高分 94.6%、平均分 94.4% 的成就,登顶全世界工程向 AI 智能体评测榜单 PinchBench v2。成为首个以正式产物身份得到 PinchBench 总榜第一的国产智能系统统。

于 59 个参评模子中,文心助手使命 Agent 排名第一,领先 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问 Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、OpenAI GPT-5.6-luna(88.7%)。

百度文心助手任务 Agent 登顶国际权威榜单,超越 Claude、GPT 拿下全球智能体冠军

这个榜单,测的是最难作假的能力

PinchBench 由 Kilo AI 推出,OpenClaw 社区维护。它及 MMLU、GPQA 这种传统年夜模子基准的区分很直接:传统基准考「模子知不知道」,PinchBench 考「智能体能不克不及把整件事做完并交付可验证的成果」。

当前版本包罗 23 个真实事情场景、147 项使命,笼罩数据阐发、研究写作、代码开发、办公主动化、文档处置惩罚、网页操作、多媒体处置惩罚七年夜种别,共完成 617 次测试运行。评分采用「主动化校验 + LLM 评审」双轨机制,全程零人工干涉干与。

百度文心助手任务 Agent 登顶国际权威榜单,超越 Claude、GPT 拿下全球智能体冠军

更要害的是,PinchBench 用在权衡模子与 Agent 框架的综合能力。即即是统一底座模子,搭载差别 Agent 框架,终极评测患上分也会存于较年夜差距。这也申明,文心助手使命 Agent 取患上榜首成就,代表的是模子能力与体系工程协同打造的综合实力第一。

baidu AI 搜刮团队于 GitHub 上开源了完备评测流程(github.com/Baidu-AI-Search/PinchBench-Evaluation),147 个使命的履行快照、交付物、LLM Judge 打分理由全量公然,任何人均可以逐条复现。

让 AI 从「动动嘴」,到「迈开腿」

好比此中一个使命是:「GitLab Q3 2025 财季的现实利润率与指引之间差了几多个基点?」没有给任何数据文件,Agent 需要自立检索 GitLab 财报原文或者德律风集会记载,定位相干指引,计较出非 GAAP 运营利润率约 18%、凌驾指引约 500 个基点,并将结论写入指定文件。

五个主动化评分维度——文件创立、指标定位、现实值与指引值提取、基点计较结论——全数满分 1.0。

另外一个使命考的是安全工程:阐发一个 Node.js 运用的多个 CVE 缝隙,按优先级分级并制订修复规划。评测要求 Agent 辨认 express RCE 及 JWT bypass 两个 CRITICAL 级缝隙为 P0,此中 JWT bypass 因存于活跃使用记载需要尤其标注;将 PostgreSQL SQL 注入定为 P1 并联合 PCI DSS 付出路径给出上下文;将仅影响构建阶段的依靠缝隙降级为 P2/P3;制订五批次修复规划,附详细部署窗口(4 月 12 日紧迫热修、4 月 14 日 P1 批次)。

LLM 评审的评审结论是「所有维度体现卓着」,患上分满分 1.0。

还有有一个合同法令阐发的 case,使命是读取一份软件办事和谈,提取要害日期、梳理两边义务、辨认危害点、天生财政择要。这类使命已往需要状师助理花几个小时。文心助手使命 Agent 的输出成果,辨认了客户方 12 项危害、供给商 10 项危害、5 项同享危害,付款布局六期分期的现金流前置问题、IP 让渡前提的产权间隙,全数做到了——终极评分四个维度都是满分 1.0。

上面这些繁杂的使命文心助手使命 Agent 都不于话下,更不消说平凡用户的一样平常办公需求。

好比,你扔给文心助手一份职业数据表,然后说「同一表头格局,新建汇总 sheet,按职业年夜类做汇总表及 Top10/Bottom10 榜单,天生图表对于比各职业年夜类就业人数。」

这是一条有内部依靠瓜葛的使命链,任何一步堕落后面就无法接。文心助手使命 Agent 自立拆解,一次性跑完。

百度文心助手任务 Agent 登顶国际权威榜单,超越 Claude、GPT 拿下全球智能体冠军

或者者你给不了这么具体的指令,想摇个盲盒:「我这周末想从北京去青岛玩两天 solo trip。」没有给任何另外信息。Agent 自立检索了交通、留宿、景点及时数据,排出完备行程、预算清单及避坑指南,交付一份可以直接截图出发的攻略。

百度文心助手任务 Agent 登顶国际权威榜单,超越 Claude、GPT 拿下全球智能体冠军

或者者你不想每一次都要问 AI,让它帮你完成反复性又高脑力的劳动,可以设置按时使命,如「每一周一夜十点,帮我汇总近一周的高质量 AI 范畴论文,用投研陈诉气势派头的 HTML 给我」。

百度文心助手任务 Agent 登顶国际权威榜单,超越 Claude、GPT 拿下全球智能体冠军

7×24 小时,用户无需时刻于场。

为何是baidu做出来了?

谜底实在很简朴:baidu是一家于用意理解上花了 20 多年的公司。

文心助手使命 Agent 依托baidu搜刮猎户座 AI 引擎的多智能体框架构建。

从架构逻辑来看,搜刮引擎自己就是最早的 Agent 雏形——吸收用意、拆解使命、挪用东西、验证成果,这条链路baidu已经经跑了二十余年。

东西集从索引爬虫进级成为了代码履行情况、文件处置惩罚器及及时 API 接口,输出从蓝链列表酿成告终构化陈诉及可运行代码,但底层逻辑一脉相承。

文心助手使命 Agent 将模子使命评估患上分晋升至 94% 以上,证实优异的体系架构与工程实现可以或许显著开释模子潜力。

也就是说,统一个底层模子,换上文心助手使命 Agent 的框架,使命完成率会更高。Agent 时代,框架工程能力的主要性正于跨越纯真的模子参数比拼。

今朝,文心助手使命 Agent 焦点技能已经周全运用在baidu App 和文心助手,可登录 chat.百度.com ,点选「使命」,便可体验。

-C17官方网站-C17(中国)
1210
在线客服
在线客服

Maggie

微信咨询

黎小姐