大厂AI入口大战升级,谁是最能干活的桌面Agent?
科技
科技 > 人工智能 > 正文

大厂AI入口大战升级,谁是最能干活的桌面Agent?

图片

作者|心怡

编辑|重点君

互联网大厂间的AI入口大战打到了桌面端。

先说一条刚出炉的消息。据《财经》7月21日报道,阿里即将推出千问办公,把QoderWork、悟空、MuleRun三款Agent产品合并成,交给钉钉新任CEO陈宇森负责。

不止阿里,腾讯也正把资源集中到WorkBuddy上,字节内部讨论把飞书和豆包办公深度整合。

信号很明确,持续半年的大厂Agent“赛马”结束,C端的入口大战刚歇,各家开始把资源集中到新战场:桌面Agent的入口大战升级了。

目前战况如何?易观数据显示,今年6月,WorkBuddy 月访问量达2097万,腾讯WorkBuddy、字节TRAE IDE、阿里QoderWork排在第一梯队(以下图表数据来自易观分析)。

四位选手各有来头。

WorkBuddy产品底座沿用打磨两年多的CodeBuddy内核,马化腾在财报会上直接称它是“中国使用最广的效率智能体服务”。

豆包专业版背靠字节自家的Seedream、Seedance,是四家里多模态弹药比较足的一个,但只跑自家模型、生态也有些封闭。

百度搭子入局较晚但动作密集、持续升级,7月刚甩出个人版升级、企业版和“搭子联盟”三个更新。

QoderWork是阿里把Agent能力从代码搬到办公的产物,招牌是带下载量排行的技能市场和15套专家套件,即将要升格为“千问办公”的底座。

一线城市机场和地铁的广告位上,大家都说自己是六边形战士。但用户更多只关心一件事:今天要选一款Agent,到底谁能真正干活?

这次,我们挑两个高频的真实工作场景,同一台Mac、同样的提示词、注册即得的免费档,把四家放在到一起对比。

两个真实工作场景,看谁最能干活

两个场景各代表一类办公刚需,一个是重复操作型,考的是手勤不勤;一个是内容生产型,考的是脑子和手艺。

场景一:打开浏览器抓一批更新,整理成一张本地表格

事情不难,但是人工做起来真的很费事,能偷的懒还是偷一偷。

因此,我们需要检查桌面Agent能不能自己“坐到电脑前”,把鼠标键盘用起来,从头跑完流程,最后交给我们一份能直接用的本地文件,而不是像问答AI只给到一个“你可以这样做”的方法。

这样一来,权限申请顺不顺、过程看不看得见、耗时稳不稳,也都在观察范围内。

我们给四位选手同一条提示词:

不得不说,用工具和测工具难的不是任务本身,整个过程很像做实验,环境没理顺,出bug总让人心里堵、想放弃。

WorkBuddy我们前几次就没测成功,细看发现它硬啃反爬、卡在无头浏览器安装上,Agent直接放弃,任务黄了。

下面的成绩,都是环境理顺之后的正式记录。

WorkBuddy老老实实地打开了openai.com/news,最终页面只渲染出9条,命令行curl又被反爬挡下(403)。但这次它没一条道走到黑,转头找到官方RSS订阅源作为“最新更新”的权威口径,按时间倒序取满10条,在桌面生成了两张表:最近10条明细+Agent中文速览独立页,还自检了一遍链接可用。

全程花了约4分钟,但我好像被骗了。任务是33分启动、37分才真正跑完,但界面上的“完成时间”始终停在33分,有一点掩耳盗铃的意味。

测下来,腾讯WorkBuddy任务执行先受阻,然后靠RSS兜底把活干完。

百度搭子在任务开始前一次性申请权限、显示开始时间,执行时直接跳到默认浏览器,你能亲眼看着它滚动翻页取数,全程约4分钟。产出10条,但摘要整列是英文、没做中文化,链接也被塞进摘要单元格,没独立成列。

测下来,百度搭子过程相对透明,速度也较快。

豆包的过程就比较偏黑箱,任务开始时不提示开始时间、网页滚动也不显示。最终产出10条,中文摘要的信息密度在四家里数一数二(带具体数字),也是唯一把“Agent中文速览”做进Excel独立页的一家。对照官方RSS时间序,它抓的这10条恰恰贴近字面的“最近”。

测下来,豆包摘要比较扎实,抓得也算准。

QoderWork选择走软件内置浏览器检索,约12分钟,四家里垫底。前期没有人工验证会一直空等;后期“真人验证”反复5次以上才过,交互比较磨人。产出结构还算规范,一共有7列、中英双标题、带分类与可点链接。比较糟糕的是把一条内容的日期认错成7-15,连带漏掉了真正7-15的新闻。

测下来,QoderWork结构规范,但慢、手动卡人机验证。

同一句提示,四家抓出的“最近10条”并不重合(✓=命中)

有意思的是,这四家抓出的最近10条,只有四条对上了。

我们将四份产出并排一放,只有4条是四家共有的,其余各不相同。

分析原因发现不是谁抓错了,而在openai.com/news本身有两套顺序:默认卡片视图是编辑精选序,RSS是纯时间倒序。豆包和WorkBuddy落在时间序阵营,贴近字面的“最近”;百度搭子和QoderWork跟着页面卡片,贴近“人打开页面第一眼看到的”。两边都不算错,但好的Agent应该主动告诉你,它用的是哪种口径。

Agent能力测评,真正拉开差距的,不是谁点得漂亮,而是最后到底有没有把东西交出来。

百度搭子、豆包和QoderWork全程真机点击,自己一步步跑完;WorkBuddy一条路走不通然后就退回RSS抄道。

但说到底,桌面Agent能不能甩给我们一份打开就能用的文件,比它中间走哪条路重要得多。卡住的时候,肯绕路的往往比硬顶的更管用。

场景二:一句话,产出公众号+小红书+口播视频三件套

换个身份代入一下。假设你是个做AI的自媒体博主,或者给博主打工的运营。7月模型圈炸了锅,这波热度必须蹭。Agent要先摸清楚这个月发生的时间,挑一个有爆款相的选题,一口气把公众号文章、小红书图文、数字人口播视频(还是很有难度的)这三件套全出齐。

这题评的是干活和交付的水准,模型新闻本身真假不核实。四家检索出来的核心事实高度一致,个别对不上的地方在点评里标出来了。

四款提示词一样:

四位选手,一个个上。

WorkBuddy一上来先建了个任务追踪,把活拆成盘点“选题→三件套→配图”,全程3分16秒,四家里最快。选题定的是《全球最大开源模型诞生——中国开源联军改写AI游戏规则?》钩子还不错,自带开源vs闭源的冲突感。

最亮眼的是公众号直接给了能渲染的HTML成品,头图压着标题,还甩出金句"美国卖铲子,中国发铲子还包邮",全文约900字,符合字数要求;小红书、口播稿、分镜表一样不落,4张配图风格还挺统一。唯一没跑完的是数字人成片(本机没渲染引擎),但它老实交代了,还主动给了个替补方案。

测下来,腾讯WorkBuddy,快,省心,东西拿到手就能用。

百度搭子动手前先正经做了需求分析,交付前还查了字数、精简了两回。它检索的数据在四家里算细的,跑分、定价、股价波动,全都有出处。选题《七月AI大乱斗》,冲突和情绪拉满。公众号走的是深度分析路子,还多合成了一段TTS口播音频,下载途中代理挂了,它自己用curl绕了过去。

不过也做的差的地方,正文1510字,比1500的硬线多了10个字;成品是.md,不是能直接渲染的HTML。

测下来,流程一板一眼,检索真的有点实力。

比赛的四家里就豆包一个命中了专门的自媒体写作技能,下笔前先把公众号、小红书、短视频分镜这些平台规范挨个读了一遍,干活的路数也像个老练的新媒体编辑。

细看发现检索面也广,光国产阵营就盘进来6家以上。

真正拉开差距的是专业度,公众号约1400字,附4个备选标题,还逐条核对了来源做内容验真;小红书连置顶评论怎么写、怎么连发矩阵、怎么回评都给了。配图里那张标着真实模型名的阵营对比图,是四家里最贴题的,另外还有数字人形象图和TTS语音。交付方式也独一份:所有成品写进一份飞书在线文档,复制就能发。毛病是头图有点文字错乱,思考独白啰嗦了些。

测下来,豆包算是一个学好规矩再动笔的学生。

QoderWork本次耗时约10分钟,属于比较慢的选手。选题“轮到闭源巨头睡不着了”,钩子合格,公众号约1480字结构挺整,小红书和口播稿也都有。真正栽跟头在多媒体:配图服务出故障,重试6次全败,图片生成失败,音频视频也没影。结尾反问了一句“需要我现在重试出图吗”,已经忘记我们“一遍跑通”的要求。

测下来,这位选手属于是文字过关,配图有点糟糕。

图为:Agent耗时相对速度

配图和多媒体,这才是这道题真正拉开距离的地方。

三家成功出图、风格统一、拿来就能用:WorkBuddy出了4张,百度搭子3张配图外加一段TTS音频,豆包的图相对最对题、数字人形象也做得突出;QoderWork呢,颗粒无收。

图为:各家生成配图与多媒体成果对比截图

文字这关,四家都不错。真正把高下分出来的,是谁能带着编辑规范和运营策略,把成品直接交到你手上,能做到这步,Agent才算得上一个靠谱同事。

跑下来最深的一点感受是:东西能不能直接用,远比文字漂不漂亮值钱。飞书文档、能渲染的HTML,拿到手就能发;换成只丢给你一堆文字加提示词的,乍看挺齐全,真要落地,剩下的活还得你自己干。

多媒体是道硬门槛,出了岔子能兜住才算有实力。任务遇阻卡住了但肯绕条路把活交付,比闷头硬扛强得多,毕竟谁喜欢不能干活给公司憋大雷的同事呢。

价格:这笔账得单独算

实测下来,好消息是大家都给了免费额度,多数情况下跑个一两个任务是够用的。

我原本也是这么打算的,不充值,就当个普通用户,拿免费额度老老实实跑一跑,这样也更贴合大家平时的真实用法。结果谁知道,跑到豆包这儿就提示余额不足了,我只能咬牙充了68块把第二个任务跑完……

所以话说回来,真打算重度用之前,还是建议先拿免费档把你天天要干的活跑一遍,看看积分烧得快不快,再决定这钱怎么掏。

谁会终结这场比赛?

两个场景跑完,没有全能冠军,但我们摸清了各位当下擅长什么。

WorkBuddy是快、省心的交付派。两场速度都在第一梯队,遇到卡壳会自己绕条路把活交了,东西拿到手就能用。短板在"亲手操作"这件事做得不够纯,计时这类小细节也不太细致。

豆包专业版是内容和多模态见长的质量派。场景二靠方法论赢了,场景一的摘要也扎实,自家的Seedream、Seedance撑着,图和音频都不掉链子。代价是全程看不见它怎么想的,生态也封闭。

百度搭子是过程透明的严谨派。权限一次给够,干活全程看得见,检索还带出处,两场都很稳。可惜两次都栽在最后一公里的打磨上。

QoderWork是货架摆得全、结构也规范的潜力股。文字底子不差,专家套件的思路也对。但两场都垫底,人机验证来回折腾,配图崩了也没救回来,眼下是四家里让人更操心的一位选手。

四家广告打得正凶,真正的胜负手根本还没露面。

这场比赛的玩法,也正在悄悄改变。

上半年整个行业烧钱烧出一条教训,Agent能生成,不等于活能交付。生成一快,复核、判断、担责这些得人来干的环节反倒成了堵点。

有研究说,自主编程Agent能把代码提交量拉高120%,可真正上线的只剩三成。就好比后厨切菜快了三倍,餐厅一天还是卖那么多桌。

所以谁赢,现在下结论太早。对用户来说,想清楚最常干的那件事,拿免费额度把它跑通,再决定掏不掏钱。

我们测的时候,这几款产品几乎是一天一个样,功能天天在变,所以这回只挑了两个场景跑,不敢说测全了。

而且现在有个大趋势,各家Agent都在抢入口,Agent正从电脑桌面往手机上挪。一个方向是手机端和桌面的联动,你人在外面,用手机就能给电脑上的Agent派活,回头它在电脑那头默默把事办了。另一个方向更有意思,是往微信这种IM里钻,你在微信或者飞书里随手一句话,活就交出去了,连App都不用专门打开。

这俩场景眼下都挺热,可惜这次没赶上测,我们留到下一轮再看。

亲爱的凤凰网用户:

您当前使用的浏览器版本过低,导致网站不能正常访问,建议升级浏览器

第三方浏览器推荐:

谷歌(Chrome)浏览器 下载

360安全浏览器 下载