对话旋玑智能CEO王业全:给机器人造一颗“智会头”

对话旋玑智能CEO王业全:给机器人造一颗“智会头”

机器人前瞻(公众号:robot_pro)

作者 | 周加琦

编辑 | 漠影

人与人之间的交流,看似只是说话、看表情、做回应,背后却是一套复杂的理解过程。

一句话说出来,人类不仅能听懂字面意思,还能结合语气、表情、前后文和当时的场景,判断对方真正想表达什么。

但对机器人来说,这是一道难题。听见声音、看见人并不难,难的是理解对方的真实意思,并在不同场景下做出合适回应。

而这正是王业全创业想解决的问题。

因此,王业全创办了旋玑智能。在这里,他更希望同事叫自己Evan,而不是王总。创始人是他近年多出来的一个身份。

清华读博期间,他挂职担任过区长助理;毕业后去了大厂,此后又进入中科院,再到智源研究院,带领他的团队研发Tele-FLM-1T等大模型,也曾主持“新一代人工智能”国家科技重大专项相关项目。

对话旋玑智能CEO王业全:给机器人造一颗“智会头”

▲旋玑智能创始人兼CEO 王业全

到了准备创业的时候,他又给自己补起了课:公司怎么治理,组织怎么搭,投融资怎么做。他还跑到机器人制造工厂,沿着产线看,追问工序为什么这样排,看起来差不多的机器人,稳定性为什么有差别。

“如果天天待在北京的办公室里听,是听不到真话的,如果去一线的产线里问,一看便都知道了。”

过去,他关心模型能做到什么程度。准备做公司以后,他开始关心一台机器人怎样被造出来,又怎样交到用户手里。

2023年,王业全判断,语言大模型的技术路线正在逐渐收敛,竞争会越来越依赖算力、数据等资源的持续投入。具身智能则还在早期,真实世界里有大量问题没有解决,让他想继续往里走。

2025年,他创办旋玑智能,却没有选择机器人本体这个赛道,也没有一上来就做一个包揽所有能力的“全能具身大脑”。他选择先做交互,在使用中积累数据,再向操作等能力扩展。

理由仍在开头那两句话里。机器人得先弄清楚人究竟想做什么,遇到不明白的地方,还要主动问一句,才能知道接下来该怎样行动。

机械臂解决“够得到”,灵巧手解决“拿得稳”,本体解决“走得过去”。至于听懂人、记住人,再调动身体做事,王业全给这类部件取了一个名字——“智会头”。

旋玑基于这一想法做了自己的产品,言传智会具身交互大脑VoxInsight。它采用软硬一体的机器人头部形态,把头部硬件与交互大脑放在一起设计。

对话旋玑智能CEO王业全:给机器人造一颗“智会头”

过去训练大模型的经验,怎样变成一颗能交到客户手里的“智会头”?当通用模型继续变强,专门做交互大脑的公司,又凭什么留下来?

围绕这些问题,机器人前瞻与旋玑智能创始人王业全展开了对话。以下为根据访谈内容整理的对话。

一、从求学到创业,他走了16年

机器人前瞻:您在清华读博期间,有哪些经历或习惯影响了您后来做研究、做产品的方式?

王业全:先分享我的一个经历。有一篇论文,我只用了五天就写完了。那是把attention机制用在情感分析上的一项工作,发表于2016年的EMNLP。

五天看似很短暂,但那五天之前,研究已经做了很久。问题怎么选,实验怎么设计,结果为什么成立,这些都已经想过、做过。到了写作的时候,需要把已经弄清楚的事情准确地表达出来。五天能写完,靠的是前面那些年积累下来的东西。

在清华读博期间,我在信息学国家实验室做研究。那段经历让我养成一个习惯:写论文时,要考虑读者怎么理解你的工作。你自己觉得做得很好,同行读不明白,问题在哪里、价值在哪里没有讲清楚,研究就很难被别人接着用下去。

后来做产品,这个习惯一直留着。我们当然知道自己的技术花了多少心血,但用户首先关心的是,它能帮我做什么,用起来麻不麻烦。

所以我很看重效率,也很看重积累。积累决定你遇到问题时能想多深,效率决定你能不能在需要作出判断的时候,把这些东西用起来。

机器人前瞻:过去您一直从事大模型研究,也主持过科研项目,是什么让您决定从科研走向创业?

王业全:实践是检验真理的唯一标准。我希望我们研究的技术能够走进产业,做成客户真正用得上、愿意付费的产品。但通过创业来做这件事,并不是我一开始就想好的。

读博的时候,我挂职担任过区长助理。身边有人觉得我适合从政,起点不错,继续走下去也有很好的发展。但毕业以后,我去了大厂。

进了大厂,身边的人又觉得,这条路也不错:继续做技术,或者带团队、做管理,都有空间。不过,那时候我还是更想深入做研究。后来去了中科院,再到智源研究院,我把更多精力放在了模型和训练这些问题上。

在智源,我带着当时的团队做大模型、推进科研项目。研究规模大了,就不能只盯着某个技术问题,还要考虑怎样组织团队、安排资源,让一项复杂的研究真正做出来。这些经历让我知道,一个想法要成为结果,中间有多少具体的工作。

随着研究往前走,我开始更多地考虑后面的事情。模型做出来了,怎样让它在实际环境里用起来?客户究竟需要什么,哪些能力值得继续投入,哪些看起来不错,却未必有人愿意买单?这些问题,单靠实验室里的结果还回答不了。

这些选择现在讲出来,是一段段经历。对我自己来说,每换一个环境,就会碰到一批过去没有面对过的问题。做研究时,我想知道模型能做到什么程度;准备创业以后,我又想知道,一项技术怎样成为产品,产品为什么有人买,一家公司怎样持续运转。

创业把这些问题放到了一起。很多事情,过去可以观察、可以研究,现在要由自己做决定,也要承担结果。我想走到这一步。

机器人前瞻:从研究走向创业,您做了哪些准备?

王业全:我用了十六年走到今天。回顾每一件事的时候,当时可能并没有一张完整的创业路线图,但是每一件事都对今天的我产生了很大的影响。

读书时,我对社会的经济运行规律感兴趣,自学了金融学,也看过一些组织治理、投融资的书籍。当时是想弄明白一些问题,后来做公司,才发现这些知识有用。但是读过书,不代表就会做。

再到工作的时候,做研究积累了技术判断,带团队让我开始理解怎样组织人,大厂和科研机构的经历,又让我看到不同的组织怎样运转。

还有一件事是跑工厂。机器人怎么制造,产线怎么排,为什么一道工序要放在这里,同样的设计为什么做出来稳定性不一样,都要到现场看。

你在办公室里听一个产品,会觉得很多事情已经解决了。沿着产线走一遍,就会发现模型之外还有这么多具体工作。创业以后,这些都会变成公司的成本、时间和交付问题。

所以这十六年,对我来说更像是不断补齐认识。到了要做公司的时候,过去分散在不同经历里的东西,开始用在同一件事情上。

机器人前瞻:您在智源、北京大学承担科研工作,同时又担任旋玑CEO——这些角色如何平衡?

王业全:先把各自的责任分清楚。科研工作有自己的目标和进度,公司也有必须兑现的交付。各自的工作要有明确的负责人和安排,需要我作出判断、承担责任的地方,我不能缺位。

对我个人来说,还要切换判断标准。做研究,我会一直追问一项技术还能做到什么程度;做CEO,我还要决定,公司现在需要把它做到什么程度,愿意为此投入多少资源。

拿旋玑正在做的语音交互大模型来说,过去的研究经验让我知道哪些方向值得继续做。但模型要放到机器人端侧,就得同时考虑算力、功耗、响应速度和成本。增加的参数到底带来了多少用户能感受到的改善,值不值得投入,都要想清楚。

过去做过大模型,反而应该更清楚怎样使用有限的资源。知道一条路可以往前走多远,也要知道产品眼下应该做到哪一步。

好奇心让我愿意投入这些事情。做了CEO以后,我也越来越清楚:想弄明白的事情可以很多,公司这一阶段真正要做的事情,必须很少。

二、为什么转向具身,为机器人做一颗“智会头”

机器人前瞻:您长期研究大语言模型,为什么最终把创业方向放在具身智能?当时您对这两个领域分别有什么判断?

王业全:做这个选择之前,我一直在想:我们过去积累的能力,接下来放在哪里最有价值?

从2022年到2024年,我在智源研究院带领和团队研发FLM系列大模型。2024年,智源研究院与中国电信人工智能研究院联合发布Tele-FLM-1T,团队把模型从52B、102B逐步扩展到了单体稠密万亿参数规模。

与此同时,我也意识到,语言大模型的技术路线正在收敛。就像造摩天大楼,基本方法逐渐清楚,接下来要把楼盖得更高、更稳,就需要持续投入数据、算力和人才。资源充足不代表一定成功,但在这样的竞争里,它的分量会越来越重。

具身智能还处在更早的阶段。模型应该学什么,什么数据真正有用,训练出来的能力怎么用到机器人上,很多问题没有解决。我们完整做过大模型训练,对数据、训练方法和稳定性的理解,在这里有发挥空间。这些经验不能代替新的研究,但可以帮助我们判断哪些问题应该先验证,少花一些反复试错的成本。

当然,具身也需要投入。放到国内的产业环境里,本体、零部件和制造环节都有可以合作的企业。我们选择把资源集中在交互大脑上,和本体及制造伙伴配合,没有必要把每个环节重新做一遍。

我的判断是,具身智能的“GPT-3时刻”,大概率仍然会建立在大模型路线上。本体越发展,理解环境、理解人、安排任务这些“大脑”的问题就越突出。我选择在这个时候进入,是认为行业接下来会越来越需要我们过去积累的研究和训练能力。

机器人前瞻:您是怎么想到要做一颗专属于机器人的“智会头”,而不直接做一个通用大脑?

王业全:做科研的时候,我就在想,机器人是不是需要一个“全能型的具身大脑”?即使最终需要,是不是也必须从第一天就把所有能力一起做?

我曾受到保罗·麦克莱恩早期三脑假说的启发,借用的是功能分工的思路:把复杂系统中的不同功能拆开,再研究它们怎样配合。我们当然希望机器人既能理解人,也能把事情做完。但短期内,把感知、交互、操作、决策和安全都做到位,难度很大。公司需要作出取舍。

我选择交互,是因为机器人要做对一件事,首先得弄清楚人到底要它做什么。人说话会犹豫、改口,也会省略信息。同样一句话,换个人、换种语气,意思可能就变了。前面理解错了,后面的动作再熟练,也可能做错事。

所以,它需要知道谁在说话,理解对方的情绪和意图,记得前面发生了什么;不清楚的时候,还能主动问一句。把需求确认下来,再调动身体去做。

我们把承担这些功能的部件叫作“智会头”。“智”是智力,“会”是能说会做。我希望它像机械臂、灵巧手一样,成为行业里一类通用部件的名称,不限定品牌和外形。它负责理解人,再连接导航、抓取等技能。具体能做什么,要看本体已有的能力和接口适配情况。

我相信将来会出现全能力的具身大脑,但这并不意味着一家公司现在就要把所有事情做一遍。旋玑先把交互做好,和擅长本体、操作的公司配合,在实际使用中积累数据和反馈,再向更多能力扩展。

过去的研究让我看到还有很多问题值得做,但公司今天要从哪里开始,仍然得看眼下最需要解决什么,以及我们最有能力做好什么。

机器人前瞻:从数字世界走到机器人,已有的AI对话能力可以直接用吗?旋玑的交互大脑还需要补上什么?

王业全:已有模型的能力当然可以用。现在的多模态模型已经能处理声音和画面,但接入一个模型,还没有完成一套机器人交互产品需要做的工作。

机器人面对的是持续变化的现场。谁正在说话,前面发生过什么,身体正在做什么,这些信息要连在一起,不能每次收到一句话都从头开始。

而且,交流会改变任务。人说“先别动”,系统需要把这个变化传到任务安排和本体控制环节。能不能及时停下,还取决于整机的控制能力、安全机制和接口配合,不能只靠模型听懂这三个字。

所以,我们面向的是物理世界里的持续交互。模型提供理解和回应的能力,产品还要把身份、上下文、任务状态和本体连接起来。旋玑要把这些工作一起做好。

三、让机器人理解人,难在哪里

机器人前瞻:聚焦物理世界之后,交互大脑具体要解决什么问题?哪些真实场景最难处理?

王业全:机器人需要边听、边说、边想,也要能配合正在进行的动作。

比如在商场里,人声、广播、叫卖声混在一起。有人面对着机器人说话,旁边的人也可能突然加入。它得知道谁在跟自己交流,几个人说的是不是同一件事,用户有没有临时改口。

我们讲高智商,是希望它回答准确、理解任务;讲高情商,是希望它能听出字面意思之外的信息。同样一句“你先忙”,有时是真的让你继续做,有时是在表达不满。机器人得结合语气、前后文和当时的情况来判断。

这些能力最终会落到很具体的体验上:人说话时能不能打断它,打断以后它能不能接着听,换了一个人,它会不会把前一个人的话接到后一个人身上。

在安静的房间里完成一段对话,只能说明一部分问题。产品到了现场,要面对的是一整段没有排练过的交流。

机器人前瞻:为了处理这些交互问题,你们在技术上怎样区别于过去把语音识别、对话理解、语音合成分模块搭建的方式?

王业全:过去很多语音系统,先把声音识别成文字,再理解文字,最后把回答转成声音。各个环节可以分别做好,但串起来以后,也可能出现等待、衔接和信息丢失的问题。

我们的方向,是用大模型重新组织交互过程,让声音里原本包含的语气、停顿和情绪等信息,更直接地参与理解和回应,也让听和说能够同时发生。

不过,一套机器人产品仍然需要合理分工。记忆、任务编排、本体接口,都有各自要解决的问题。比如EgoMem可以作为相对独立的记忆模块,这和用大模型重构语音交互并不冲突,它们处在不同的层面。

我更在意的是,这些能力连起来以后,用户会遇到什么。人突然插一句话,系统能不能接住;任务中途发生变化,后面的动作能不能调整。技术路线的价值,要在这些地方表现出来。

机器人前瞻:采用大模型来重构交互,团队过去训练基础模型的经验,具体有哪些能够迁移?

王业全:回到第一性原理,首先是知道怎样把模型稳定地训出来。

过去在科研机构做大模型时,我和当时的团队研究过模型生长和训练稳定性,探索怎样提高训练算力的使用效率。从较小的模型逐步扩展到更大的模型,怎样保留已经学到的能力,让训练继续稳定地进行,里面有很多具体问题要解决。

这背后积累了很多具体判断:什么数据值得用,训练出现异常应该先查哪里,哪些投入能带来能力提升。完整走过这个过程,面对新任务时,就有更多依据。

今天做语音交互大模型,还要把这些经验用在资源约束里。面向端侧,我们考虑更轻量化的模型规模,就需要决定有限的参数和算力优先服务哪些能力。对机器人来说,听懂改口、及时回应、记住必要的信息,都直接影响使用体验。

参数、延迟、功耗和成本之间需要平衡。过去有能力做大模型,今天就更应该知道,怎样把资源用在用户能感受到的地方。

当然,语音和物理场景有自己的问题。已有经验可以帮助我们少走弯路,具体的数据和训练效果,仍然要一项项做出来。

机器人前瞻:除了当下这次对话,机器人还需要记住些什么?你们目前通过EgoMem怎样实现,长期又准备沿什么方向研究?

王业全:首先要知道眼前的人是谁,也要记得两个人之前发生过什么。

第一次见面和再次见面,交流方式应该有区别。用户说“还是上次那个”,机器人需要知道上次指的是什么。但记忆也要按场景使用,有些信息不需要留下,有些涉及隐私,不能为了记得多就全部存起来。

目前,EgoMem通过视觉、听觉、语言等模块,把身份和相关信息组织起来。视觉帮助认人,声音帮助区分说话者,语言记录交流中的内容,还包括人与人之间的关系。这条路线能够较快地支撑产品应用。

我们也在研究更长期的原生融合路线,希望把记忆能力更深地放进模型。包括怎样低成本地更新相关参数,怎样存储和刷新不同时长的信息,这些都还需要继续研究和验证。

两条路线承担的任务不同。当前方案要先把产品里的记忆做好,长期研究则要回答怎样让记忆与模型本身配合得更自然。

对用户来说,记错一个人、把两个人的事情混在一起,都会影响信任。能记住什么,记错了怎样纠正,和记忆容量一样重要。

四、打造一颗“智会头”,还要交到客户手里

机器人前瞻:您提出了“智会头”的概念,并把交互大脑做成了VoxInsight。为什么这款产品选择机器人头部的形态,而不只提供算法或软件?

王业全:我们看过、测过一些机器人的头部,发现要满足我们设想中的交互需求,传感器、算力和表达方式之间,还需要进一步配合。机器人真要跟人交流,就得有眼睛、有耳朵、有嘴巴。有人从旁边跟它说话,它要能注意到,头也要能转过去。这些事情放在一起,对硬件的要求就不一样了。

交互大脑是一套软件,可声音没有收好、画面没有看清,后面的模型就会受影响。现在各家的硬件又不完全一样,软件和硬件怎么配,往往还得重新处理。

所以我们决定自己做,做出来的产品就是VoxInsight。

VoxInsight 不是从零开始。在智源和乐聚联合实验室里,我们研发的RoboBrain-Audio已经验证了交互路线,VoxInsight要做的是把它推进到可量产交付的产品形态。

我们的选择是把头部和里面的大脑一起设计,模型需要什么样的输入,硬件怎样配合,都可以从一开始安排好。我们希望软件和硬件能够相互配合,让1+1>2。

我们还是希望和本体企业分工。他们继续把身体和操作能力做好,我们把与人交流的这颗头做好。接入不同本体时,还要分别完成接口适配和整机验证。以后“智会头”能像机械臂、灵巧手一样,被不同的机器人采用,这是我想推动的事情。

机器人前瞻:在应用场景上,旋玑为什么选择商业服务作为切入方向?

王业全:因为在商业服务里,交流本身就是工作的一部分。机器人要面对不同的人,也要应对临时变化的要求。

一个人问某个地方怎么走,可能只需要一个方向,也可能需要带路。它得先弄明白对方的意思,再根据自己具备的能力提供服务,不能回答完一句话就结束了。

而且,具体到一个商业服务项目,服务内容和业务流程相对容易界定。机器人负责什么,做到什么程度算完成,处理不了的时候怎样转交给人,都可以和客户逐项明确。交互能力有没有用,要放到这些实际任务里看。

所以,我们从产业和需求出发,梳理商业服务里值得进入的具体场景。但到了公司经营层面,仍然要控制投入节奏。关注一个场景,不意味着已经完成适配,也不意味着要把所有项目同时铺开。

具体项目上,我们会优先考虑需求是否明确、能否形成交付、能不能沉淀出以后继续使用的能力。我们希望同一套理解人、记住人、安排任务的能力能够逐步复用;但到了具体的硬件和业务流程,仍然要针对不同情况做适配。

长期希望做得通用,眼下就更要把每一次交付做得更具体。

机器人前瞻:沿着这些应用方向,VoxInsight在对接需求、实现销售时,最难的是什么?

王业全:客户说自己需要什么,和最后能够交付什么,中间往往还有一段距离。

他希望机器人更聪明,但“更聪明”要变成具体的要求:在什么环境下用,面对哪些人,需要完成什么任务,出了问题怎么办。公司要把这些问题问清楚,才能判断哪些能力可以直接提供,哪些还需要继续开发。

同时,客户既希望能力强,又希望稳定,价格还要合适。模型演示做得好,到了批量使用的时候,成本、硬件适配、维护都会成为问题。

这也是我一直说的,要让机器人照顾人,而不是人去照顾机器人。设备交到用户手里以后,不能还需要他每天花很多时间研究怎样让它正常工作。

所以我们要关心客户买了以后是否愿意继续用,后续还会不会采购。卖出去之后的使用情况,会不断告诉我们,前面的产品判断到底对不对。

五、具身智能的下一程在哪里

机器人前瞻:从公司经营回到整个行业,您觉得具身智能现在是有泡沫,还是处在爆发前夜?

王业全:我个人认为,这两件事可以同时发生。一个方向有长期价值,也可能在某个阶段被寄予过高的期待。

身处其中,公司还是要回到自己的工作上。客户有没有真实需求,产品有没有解决问题,交付以后能不能继续使用,这些事情比判断热度更具体。

行业热的时候,有更多资源愿意进来,我们应该把它用来做好产品。真正能够留下来的,也需要这些日常工作的支撑。

机器人前瞻:从本体、“大脑”到世界模型,具身领域不断出现新的关注点,您怎么看待这些变化?

王业全:说明这个领域还有很多问题值得研究,大家也愿意继续投入。

但对一家公司来说,不能每出现一个新方向,就把原来的事情全部放下。我们需要判断,它能帮助解决什么问题,与现有的产品有什么关系,值得投入多少资源。

我对新东西一直有兴趣,现在会多问一句:这项能力如果做出来,用户会在哪一步感受到变化?如果能改善交互、提高任务完成的稳定性,或者让部署成本更合适,就值得认真看。

研究方向可以保持开放,公司的投入仍然要有先后。

机器人前瞻:如果交互脑、操作脑各自继续发展,未来通用模型有没有可能把两类问题都解决?到那时,还需要专门的交互大脑吗?

王业全:我相信,长期来看会出现能力更完整的具身大脑。到那时,交互和操作未必还按今天的方式分开,公司也不需要一直守着同一个模块边界。

旋玑希望持续做深的,是怎样把真实交互里的问题带回模型训练,再把改进后的能力放到机器人上。人为什么打断它,它为什么认错了说话者,任务变化为什么没有传到动作上,这些问题要能找出原因、继续改进。我们要研究用什么数据、怎样训练,也要把模型与软硬件的配合做好。

模型能力变得通用以后,产品仍然要面对具体的人、具体的身体和具体的场景。适配、交付和服务也要有人负责,但这些工作要和前面的模型研发连起来,才能不断改进产品。

我们今天从交互切入,积累的是理解人的能力,也是让模型在物理世界里发挥作用的经验。随着技术发展,公司当然会继续扩大能力范围。至于哪些自己做、哪些和合作伙伴一起做,要看效率、成本和用户需要。

做具身领域的AGI,是我们的长期目标。走向这个目标的过程中,产业分工也会继续变化,公司要有能力跟着往前走。

机器人前瞻:您希望未来旋玑智能是一家什么样的公司?

王业全:首先,我觉得很幸运,我们身处时代浪潮之中,时代赋予我们机遇去做选择。

我希望以后一家企业做机器人,选用“智会头”能像选机械臂、灵巧手一样自然,不必再把理解人、与人交流的能力从头做一遍。对旋玑来说,重要的是有多少企业愿意采用我们的产品,并在这个基础上继续做出自己的东西。

行业要发展起来,不能每家公司都把所有事情重做一遍。

中国有很好的制造和供应链基础,我希望在机器人的核心大脑能力上,也能长出一批有原创能力的公司。旋玑要争取成为其中一家,参与决定下一代机器人怎样理解人、怎样与人一起共事。