Agent背后,是工程化的系统性交付。
作者|Lynn
编辑|郑玄
企业正在为一堆「不产生价值的 Token」买单。这句 Palantir 公司 CEO 在节目里说的话,一经播出就广泛流传。抛开背后的商业竞争不谈,这句话被广泛传播,就是因为戳中了当下人们的体感,行业的注意力,渐渐从「模型多强,用了多少 Token」变成:这些 token 到底帮我解决了什么,智能是否真的转变成了生产力。
Agent 这个产品形态,当初有多 fancy,如今就有多祛魅。一个任务扔进去,模型自顾自跑上几个小时,token 哗哗地掉,交付回来的东西却不一定能用。
模型强是前提,但只靠模型不够,还需要整套让能力收拢、稳定交付的工程。
从这个视角来看百度搭子最近的成绩,会更有意思。WAIC2026 上,百度搭子入选大会「镇馆之宝」,并且是十大获奖展品中唯一的通用智能体产品。荣誉只是表象,背后的数字是:自全量上线以来,用户日均提问次数涨了 20 倍。这说明,用户不是来试几个新鲜问题,而是开始把资料整理、信息检索、PPT 生成、内容创作这些真实任务交给它。
01
单点能力跑不远
先说一个越来越公认的事实:做好 Agent,不是给模型套一个 API。
同一款底层模型,交给不同团队,跑出来的结果可以差很远。因为一个任务从进来到交付,中间要过很多关:理解用户需求,拆解小步骤,每一步该调什么工具、哪个系统,执行完还要判断质量、必要时自己返工,最后把过程里的经验沉淀下来。长链路操作鲁棒性考验的就是工程。
如果说模型决定了 Agent 智能的上限,harness 决定了它能不能稳定地摸到上限,它决定了模型往哪走、调什么、何时停、错了怎么办。
这也解释了智能体赛道早期的一个现象。不少产品靠一个亮眼功能,或者蹭一波模型红利跑了出来,热闹一阵,没多久就很少再被提起。Agent 产品多,卡在半途的 Agent 也很多。
因此在 Agent 类的产品中,除了灵光一现的设计,更需要踏实的技术积累。百度搭子在信息检索这一关上幻觉更少、找得更准,靠的不仅仅是模型的智能,还有百度多年搜索的经验——怎么判断信息可信、怎么在一堆结果里定位到有价值的那条,这些经验被搬进了 Agent 的执行链里。再往上一层,每一步该调哪个工具、哪个系统,背后是百度搜索、网盘、地图等成熟能力被接入同一条执行链。
在 OpenClaw 生态的公开 Agent 评测 PinchBench 上,百度搭子以 93.3% 和 93.2% 拿下前两名。真正值得看的是一组对照:同一款底层模型,放进百度搭子的框架能跑到 93.3%,换到 Anthropic、OpenAI 自己的框架里,则是 89.0% 和 91.6%。模型没变,成绩的差异,就说明了外面这层工程的实力。
工程之外,还有一关平时不被注意,但做不好不但会影响产品体验,甚至会带来后果的事情:安全。Agent 要替人类删文件、改系统、发数据,权限就不能是完全敞开的。百度搭子从权限、审计、隔离、确认四个维度兜底——员工能用哪些技能、碰哪些数据是限定的,所有操作可追溯,沙箱和本机环境完全隔离,删除、外发这类高危动作必须人工点头才执行。这套东西不性感,却决定了企业客户敢不敢把 Agent 放进真实流程。
大规模落地还有另外一个关键:成本。6 月的引擎升级里,在任务效果不降的前提下,执行过程的 token 消耗压低了 75%。约等于用四分之一的 token,做完了原来的工作量。而 token 能压下来,又跟百度自己有模型、有云、有芯片布局分不开。正是因为每一层都有布局,联合优化带来的空间才能够更大。
换句话说,跑出一个搭子,背后是一整个百度。
02
从个人到企业,在真实任务里长出场景
工程是说给行业听的。另一方面,对用户来说,一个 Agent 好不好,就一条,能不能把他真正头疼的事办了。
老万,70 岁,长白山的野生动物摄影师,手里攒了一百多 TB 的红外相机和监控素材。他最头疼的不是拍,是看——几个小时的视频,靠人眼一帧帧回放,挑出有动物出现的画面,眼睛先扛不住。他不会写代码,也没有团队,只是用平常说话的方式给百度搭子下了个指令:把有野生动物的画面挑出来、单独建个文件夹、再按我的习惯整理一份监测日志。原来要靠人眼熬着一帧帧回放的活,现在他说完需求就能拿到挑好的片段和整理好的日志——70 岁的眼睛,从这道工序里解放了出来。
杭哥,在杭州开缝纫教室,教零基础学员三天速成。他最耗神的环节,是把学员「想要通勤一点」「想显瘦但别太夸张」这样模糊的话,变成能落地的服装方案。过去要反复沟通、反复改图,一张效果图能耗掉一天。现在他把学员的描述丢给百度搭子,效果图、版型建议、面料推荐、制作成本,连带上课用的课件大纲,一次对话就出来了。
这两个案例的共同点是,用户并没有在学习一套复杂软件,也没有为了某个垂直需求单独搭系统。他们只是把目标说出来,百度搭子把背后的工具、数据和流程组织起来。
这两个人都是自己所在领域的专家,没有技术背景。他们的麻烦过去也不是花钱就能解决的。一个摄影师、一个缝纫老师,不会为筛素材、画版型去搭一套系统,市面上也没有正好接住这种活的工具。现在可以实现的,是过去他们够不着的一副外挂:一句日常的话,就能调动一整套本来不属于个人的能力。
能实现如此专业的系统性能力交付,可以从百度搭子成长路径来看。
百度搭子的成长路径,并不是先做一个轻量聊天工具,再慢慢加功能。更准确地说,它一直围绕「完成任务」来扩展能力:个人版补齐多端共享记忆、Browser Use、PPT 生成和自媒体专业套件,企业版则把这些能力带进团队协作、权限管理和组织资产沉淀。
最新长出来的一个场景,有点出人意料。世界杯期间,百度搭子进了央视频的《超级绿茵场》,在「AI 战术分析时刻」里,把进球、跑位、防守漏洞,拆成普通观众能看懂的战术。把同一套分析能力挪到看球这件事上,它就多出了点陪伴的意味。有意思的是,让它能陪你看球的,正是它平时用来干活的那套分析能力,它能去到哪些场景,其实不由它预设,而由有人把什么样的问题带到它面前。
03
一个 Agent 能走多远,取决于背后的系统
一个 Agent 能走多远,短期看它现在能做什么,长期看它靠什么越做越好。
答案在那条链的内部。全栈的各层之间,不仅在技术层面能够默契耦合的,也成为了数据优化的天然通道。智能体被用起来,产生真实的任务数据,这些数据回过头优化模型;模型的需求,又牵动着芯片和算力怎么调度;产业里的真实场景,则反过来检验这个智能体到底有没有解决问题。转得越快,迭代越快,成本压得越低,落地也越深。
所以,百度搭子站上 WAIC『镇馆之宝』的位置,并不是一个孤立的展会荣誉。公开评测里的成绩,说明它在长任务执行上跑出了结果;央视频世界杯里的战术分析,说明它能进入高关注度的大众内容场景;日均提问次数 20 倍增长,说明用户正在把真实任务交给它。
Agent 这场比赛当然才刚开始。但至少在这个阶段,行业已经不只是在看谁的模型更强、谁消耗的 Token 更多,而是在看谁能把智能稳定地转化成结果。百度搭子这次被放到 WAIC 智能体 C 位,真正被看见的,也是这件事。
*头图来源:百度搭子