办公Agent爆火,模型大战进入下一阶段
科技
科技 > 人工智能 > 正文

办公Agent爆火,模型大战进入下一阶段

模型大战,终究是入口和生态大战。

作者|Cynthia

编辑|靖宇

从今年 6 月到 8 月初,短短不到 60 天时间,有一件事几乎同时在新 BAT 发生。

先是 6 月,阿里率先开启内部 Agent 的产品线与能力大整合,到 8 月 3 日,官宣在编程(Coding)和专业办公(Cowork)能力大幅提升的 Qwen3.8 模型的同时,正式将内部孵化的三款 Agent 产品 QoderWork、悟空、MuleRun 合并为统一的 Agent 产品「千问办公」。

紧随其后,7 月 20 日,腾讯开启业务整合,QClaw 的相关业务和团队被并入 WorkBuddy 体系。

10 天后的 7 月 30 日,字节跳动宣布飞书产品团队整体并入豆包,飞书负责人谢欣向豆包负责人赵祺汇报。

不同的组织结构、不同的产品积累和优势市场,三家中国最顶级的互联网企业却在相近时间作出相似整合选择。这不太像巧合。

更合理的判断是,这种整合,是在 AI 行业走过摸索期,进入入口争夺阶段背景下的必然选择:过去,大厂需要用多个团队验证桌面操作、云端执行和企业协作等不同路线;现在,主要产品形态已经逐渐清晰,竞争也开始从能不能做出 Agent,转向谁能成为用户和企业的统一入口。

而千问办公作为这轮收束中最新落地的产品,也是最适合观察观察行业变化的样本。

作为阿里阶段性的能力重组,它将此前分散在模型、桌面端、云端和企业协作场景中的积累,装进了一款新的独立产品。

同时,它身上也集中体现了企业 Agent 竞争中最关键的几个问题:内部赛马为什么此时结束,企业 IM 与云为什么成为 Agent 的底层资产,以及模型、产品和真实任务如何形成共同进化的闭环。

读懂它,就读懂了企业级 Agent 真正的赛点。

01

大厂为什么同时收敛路径

大厂为什么几乎同一时间开始整合 Agent 产品?

拿阿里来说,在今年年初,同时保留 QoderWork、悟空和 MuleRun,是合理的。

三款产品代表了三种不同判断。

QoderWork 运行在用户电脑上,擅长读取和处理本地文件;悟空试图进入钉钉的企业账号、权限和应用体系;MuleRun 从一开始就运行在云端,可以长时间执行任务,也更早进入海外市场,截至今年 5 月,它已经服务了 43 个国家和地区的企业和用户,其中单月付费超过 200 美元的用户占比达到 34%。

在市场尚未定型时,三个团队分别测试本地执行、企业协作和云端运行,可以帮助阿里更快地找到方向。

问题在于,试错期不会一直持续。今年上半年,行业对通用 Agent 的理解发生了明显变化。

Anthropic 发现,许多非技术员工会绕过普通聊天界面,直接使用 Claude Code 整理文件、处理表格和完成多步骤知识工作。于是,Cowork 在随后被做了出来:它保留 Claude Code 的任务执行能力,但换成更适合普通知识工作者的交互方式。

相似的变化也发生在老对手 OpenAI 上。在 OpenAI,一部分用户在 ChatGPT 里处理编程问题,另一部分用户则在 Codex 中完成报告、图片和数据处理等非编程任务。聊天、编程和办公之间原本清晰的产品边界, 开始被用户主动打破。于是,7 月下旬,OpenAI 将独立运行近一年的 Codex 并入 ChatGPT 桌面客户端内,至此 Chat、Work、Codex 三端合一。

而于千问办公的此次动作来说,它同样也是阿里三场实验验证过的能力重新组合:桌面端继承本地文件和电脑操作能力,云端承接长任务、资源调度与多模态生成,企业端则继续进入组织身份、权限和业务系统。把原来分散的产品能力和反馈数据,集中到一个入口、一套工程体系和一个迭代闭环中。

千问办公实测,可以快速根据需求产出专业报告之外,还能直接打通钉钉发送到聊天界面

用户在自发的用脚投票,市场也已经没有给大厂留下太多继续分散试验的时间。

易观分析发布的二季度报告显示,2026 年 6 月,17 款主流桌面端 AI 办公智能体的合计访问量已经超过 6000 万次。腾讯系、字节系和阿里系产品相加约为 5622 万,留给其他玩家的市场不到 500 万。

技术路线逐渐确定,头部效应也开始出现,这时候,分散就会成为资源分配上的负担。

工程层也是同理。过去,模型每升级一次,三支团队都要针对务规划、上下文管理、工具调用、失败重试、权限控制做一次重新适配,这本质上是一种不必要的重复劳动

千问办公就是在这个分秒必争背景下出现的产物。

02

企业 Agent 的分水岭

目前市场上大多数通用办公 Agent,首先解决的仍然是个人生产力问题。它们可以读取用户电脑里的文件,分析个人文档,理解历史对话,整理个人日程,再根据用户本人拥有的权限调用有限的外部工具。

但这些主要是个人上下文。个人上下文的叠加不等于企业上下文。企业内所有人的效率相加,也不等于企业效率。给每位员工配置一个更聪明的个人助手,可以提高局部产出,却未必能够改善整体信息流转、任务协同,以及个人结果转化为组织行动与结果的效率。

企业面对的是另一类问题。

企业并不是个个人账号的简单集合。所有员工的文件、对话和任务相加,也不会自动变成企业的运行方式。同样一份文件,在个人 Agent 看来可能只是一份需要总结的材料;在企业 Agent 看来,它还涉及谁可以阅读、谁需要确认、结论应该同步给哪些部门,以及后续任务必须经过谁批准。

这是企业级 Agent 与个人办公 Agent 最根本的区别。也是相似的整合背景下,中美大厂行为逻辑产生明显区别的一个认知基础。

OpenAI 和 Anthropic 主要在合并聊天、编程和桌面执行入口。中国大厂的整合范围,则包括了钉钉、飞书这样的企业协作软件,同时也让云成为了 Agent 底层能力的一部分。

体现在企业内部产品协同上,豆包产品线融合飞书的同时,也与火山引擎深度结合。千问办公合并了此前主攻钉钉场景的悟空,也同时继承了阿里云过去在企业级服务市场上关于行业认知、数据管理、资源调度的全方位资源。

也就是说,是 Agent 开始吸收 IM 与云,把它们变成底层的 infra。

云作为 Agent 核心 infra 的重要性不比多说。这里我们主要看看 IM 的整合叙事。

传统办公软件按照功能划分世界:邮件负责沟通,文档负责写作,表格负责数据……但真实世界中,用户想完成一个目标,需要的是对中工具能力的组合,Agent 也是同理。

也是因此,过去十多年,整合了沟通、员工身份、组织关系、协作网络、文件、会议、审批、权限和各种企业应用连接的钉钉式 IM,作为功能最多,也包含完整组织上下文的软件,必定会成为 Agent 时代最底层的能力支撑。

我在自建的钉钉组织群里模拟了一段三人选题讨论,让千问办公总结讨论要点并提取待办事项。它不仅从对话中识别出了五条待办,每条都正确分配了负责人,还给紧急的那条标了较高优先级和即将截止,并直接写入了钉钉的待办系统。

当然,对一个外部的第三方 Agent 来说, 通过连接器读取群消息,再生成一份摘要,或者完成投研、网页制作或者表格处理并不困难。真正难的是写回:创建待办、调整日程、发送邮件、提交审批,或者把任务分配给正确的人。

读取只需要接口,而写回需要更高的信任。企业必须确定 Agent 能看到什么、可以替谁操作、哪些步骤需要审批,以及发生错误后如何追溯和撤销。从这一方面来看,过去十多年里,钉钉为 Agent 的积累不仅是工具,更是信任与企业级上下文的护城河。

03

模型和 Agent,成为智能飞轮

如果再将眼光进一步收敛到国内的一梯队玩家,不难发现,阿里在这场竞争中还有一项少见的条件。它同时拥有一线大模型、企业协作平台和云计算基础设施。

但模型和应用都在自己手里并不会自动转化成优势。只有模型和 Agent 能够相互提供反馈时,这种组合才真正有价值。

于是,我们看到,推出千问办公的同日,阿里低调放出在编程(Coding)和专业办公(Cowork)方面能力大幅提升的 Qwen3.8。

这背后的逻辑在于,在生产环境中,Agent 可以为模型提供一种比聊天记录更有价值的反馈,模型又能一劳永逸的解决 Agent 中的底层问题。

比如,很多 Agent 产品中很多看似发生在应用层的问题,根源其实在模型层。过去,模型选错工具,产品团队可以增加一条调用规则解决;模型在长任务中忘记最初要求,团队也可以在外面再套一层工作流;这些应用上的修补客观上可以降低错误率,却不能改善模型本身的判断与认知能力。

因此,我们可以看到 OpenAI 推出 Codex 时,没有只是给通用模型接入代码编辑器,而是训练了面向软件工程任务的 codex-1。它使用真实编程任务进行强化学习,能够读取和修改文件、运行测试,并根据测试结果继续调整,直到得到通过的结果。它的出现,一举改善了开发者们在编程任务中的大量问题,也成为 OpenAI 在编程领域逆袭的关键。

模型解决了 Agent 的底层能力问题,Agent 也可以为模型带来比聊天记录更完整的反馈

对 OpenAI 和千问系列模型来说,Agent 留下的完整行动轨迹,可以告诉模型它如何理解目标,制定了什么计划,调用了哪些工具,在哪一步偏离要求,用户修改了什么,以及最终产物是否真的被使用。尤其在代码任务中,在代码任务中,能不能运行、测试有没有通过、文件是否正确修改,通常可以被机器验证。而这种真实企业任务中的失败轨迹又能反馈给模型,成为模型迭代的动力。

最终,Agent 为模型提供真实任务反馈,模型为 Agent 提供更强的判断能力。模型+ Agent 构成的,正是一套持续运行进化的飞轮系统。

04

结尾

当然,客观来说,千问办公这次整合完成,并不意味着阿里关于 Agent 的探索从此就可以高枕无忧了。但它至少说明,阿里已经找到了自己的主线。

当越来越多 Agent 都能制作 PPT、分析表格、控制浏览器时,各种 To C 式 Agent 的功能差异会快速缩小。未来真正的差距,将来自产品背后的系统能力:它掌握多少企业上下文,能够获得多大的执行权限,又能否把每一次 Agent 真实任务变成下一次模型升级的依据。

在这个过程中,IM 的上下文,infra 的基础能力建设,模型与 Agent 的飞轮缺一不可。

千问办公,已经拿到了半张门票。

亲爱的凤凰网用户:

您当前使用的浏览器版本过低,导致网站不能正常访问,建议升级浏览器

第三方浏览器推荐:

谷歌(Chrome)浏览器 下载

360安全浏览器 下载