清华博士二次创业,把机器人送到汽车产线|对话光象科技CEO

机器人前瞻(公众号:robot_pro)
作者 | 周加琦
编辑 | 漠影
一辆汽车下线,要经过成百上千道工序。对工厂里的机器人来说,重复执行并不是难事,但当生产线发生一点变化,问题就来了。
零件换了位置、工件发生偏移,甚至只是摆放角度不同,机器人原本学会的动作就可能失效。机器人真正需要解决的,不只是把一个任务做好,而是换个任务或场景,依然能够准确完成。
这也是具身智能真正落地必须要面对的挑战。
从VLA到世界模型,行业正在尝试让机器人摆脱对单一任务、固定环境和大量重复训练的依赖,获得更强的泛化能力。
而在这个已经不断升温的赛道里,张涛和光象科技是一个有代表性的玩家。

▲光象科技创始人兼CEO 张涛
2025年4月,张涛与清华大学教授李升波共同创立光象科技。相比不少已经在具身智能领域布局多年的企业,光象的成立时间并不算早。
但在进入这个新赛道之前,张涛已经在科研和产业之间走了十多年。
张涛博士毕业于清华大学,曾在米兰理工大学从事过博士后研究。回国后,他选择进入高德工作。另外,他还有过一次创业经历。在汽车、空间感知、导航和自动驾驶等领域,他有着技术、产品和落地的多重经验。
这段经历也让他形成了一套对技术与产业的理解:科研更多解决的是从0到1,探索未知、实现技术突破;而产品和产业则要完成从1到100,需要经过工程化、产品化、验证和持续迭代,最终真正创造价值。
在他看来,具身智能恰恰同时需要这两种能力。
一方面,它仍然有大量未知问题需要解决,需要从0到1突破模型、算法和泛化能力;另一方面,机器人最终必须进入真实世界,把技术变成可以使用、可以复制、能够创造价值的产品。
这也成为张涛第二次创业选择具身智能的重要原因。
但在技术路径上,光象科技更关注具身智能如何实现通用和泛化。在他们看来,机器人面对陌生环境和任务,不能只依赖过去学过的动作,而需要理解动作与环境变化之间的物理因果关系。
这正是光象科技探索“物理原生智能”的切入点:让机器人理解物理世界,从而获得更强的通用和泛化能力。
2026年6月,光象科技发布轮式双臂机器人Phi-Bot X1,并进入汽车制造产线;两个月后,又发布Phi-WM 1.0 ActEffect物理原生世界模型。

从科研到产业,从技术到产品。张涛十多年积累的经验,汇聚到第二次创业。他现在试图回答的,是一个比“机器人能做什么”更底层的问题:当机器人真正进入物理世界,什么样的智能才能支撑它完成更多陌生任务,并成为新的生产力?
近日,机器人前瞻与光象科技创始人兼CEO张涛展开对话,围绕他的创业、技术方向以及行业趋势等话题进行了深入交流。以下是本次对话的实录,机器人前瞻在不改变原意的基础进行了调整。
一、从0到1再到100,一个复合型创业者进阶
机器人前瞻:相比目前很多具身行业创业者不一样,您兼具创业、科研、大厂三重经历,是一个复合型创业者,这些经历对您这次创业会带来哪些不一样的视角?
张涛:在不同的角色里,关注的内容和思考方式确实有差异。
科研更多的是探索未知,解决“从0到1”的问题,更专注于从底层上推动技术的进步,需要有很强的韧性和探索欲。
而做产品追求的不仅是0到1,而是0到1再到100。真正把一个东西从雏形打磨成完善的产品,需要经历工程化、产品设计、测试验证并反复迭代,建立质量闭环,还需要团队之间分工明确、密切配合。
我早期在学校做汽车电子、导航和信息化这类产品时,本身技术没有那么难,需要的团队也不用那么大。但若真正想让产品变得更好用,被广大用户接受,小团队是无法支撑的。后来在高德的经历,让我真正理解了如何把一个产品从雏形打磨成成熟产品。
今天我创业做具身智能,既要“从0做到1”,也要“从1做到100”。0到1要解决的是泛化性、通用性,以及模型结构和算法能力的突破;1到100则要把成果转化成生产力,真正服务客户、落地应用,这两种能力都非常重要。
机器人前瞻:您在高德待了近9年时间,回头来看,这一段经历对您当下的创业最大的帮助是什么?
张涛:我当时加入的时间蛮特殊,正好经历了它被收购,以及从传统图商向互联网公司的转型。
这个过程中,我最大的收获之一是聚焦。高德最初拓展了很多业务,而且比较分散,收购后砍掉了一大半业务,聚焦在引擎和数据两个方向,最终打造出国民级产品。这让我意识到,我们面前可能有千万个机会,但一定要先在一个点上取得突破,再去“四面开花”。
另外一个很重要的变化,是组织方式。高德从传统图商向互联网公司转型后,各个角色之间需要更加紧密地配合。我们当时很强调“战功”精神,无论技术、产品还是业务上的关键攻坚,都会当作一场仗来打。大家打破“部门墙”和边界,共同为一个结果努力。
这段经历让我真正理解了,一个成功的公司是如何通过新的组织形式和体系化的作战方式,把产品能力和商业价值展现出来的。
机器人前瞻:这一次创业跟第一次比,面对的资本环境和市场环境有区别么?主要的区别有什么?
张涛:我第一次创业是在2010年,当时国内的VC机构和市场化基金还比较少,第一次创业更多还是来自头部企业的支持。
2014年“大众创新、万众创业”开始后,外资机构涌入,带来了蓬勃发展的创新创业浪潮,我们确实从那个时代看到了很多创新企业和创业机会。
到今天,我认为资本已经经历了多个周期的变化。我们2025年成立光象科技,应该处在上一个资本周期寒冬的尾声。从2024年底到2025年逐渐复苏,到今天又一波新浪潮。资本本身是有周期的,起起伏伏很正常,这轮我预期也不会持续特别长时间。
所以对我来说,做具身智能不是一锤子买卖,而是一个长期的事情。无论是处在资本高点还是低点,都要有能力穿过周期。
机器人前瞻:您有丰富的大厂和项目经历,李升波老师学术造诣深厚,日常在公司中,您二位如何分工?
张涛:我们的分工非常明确。
李老师是行业里非常顶尖的专家学者,负责把握技术方向。比如最近发布的物理原生世界模型,从技术理论体系到核心技术创新,他都有非常深入的投入和指导。
公司日常运营管理、产品和业务方向、组织建设等工作则由我来负责。因为我过去在产业界的经历比较多,这些事情也需要投入大量精力,所以我们形成了这样的分工。
二、做一家务实的公司
机器人前瞻:目前光象科技的团队规模如何?团队构成大概是什么样?
张涛:我们现在大概是有大几十人,预期到年底达到百人规模。
现阶段我们还是以研发人员为主,占比在七成甚至更多,主要围绕核心技术和产品竞争力进行建设。等产品有了阶段性成果后,我们再逐步补充业务拓展、商务、产品等团队,完善整体配置。
机器人前瞻:光象科技在种子轮和天使轮融资的时候,当时是怎么说服IDG和东方富海的?
张涛:我们并不是说服他们。
整个过程,我们告诉他们光象是谁,我们有什么、想做什么。如果他们认可,那么就愿意来支持我们。我们也非常感谢之前的投资人,在光象还比较早期的时候,他们看到了光象身上的优势和未来的潜质。
另外,我们并没有特别针对谁专门说服他,而只是把公司的核心竞争力和愿景清晰的表达出来。
机器人前瞻:当时您们这个项目最吸引投资机构的是什么?
张涛:一方面,我们在具身智能领域有比较丰富的技术积累,包括底层技术体系、强化学习、模型、感知等,汇聚了一批具身智能全栈人才。
另一方面,我们整个团队的风格比较务实。这个词是我们的客户和投资人反复提到的。
现阶段我们不仅是发一篇paper,或者做个最好的demo show,而是希望真正做出能够落地的产品,为客户创造价值,并持续投入资源把产品打磨好。
这一点投资人其实也能看到。最开始我们和车厂合作做机器人场景时,他们知道车厂很难进入,这个事情也很难做,但还是愿意相信我们。到今年我们再向他们汇报进展时,他们反而没想到我们真的一直在死磕,并且真的做出来了。
三、世界模型不只预测世界,更要理解物理因果
机器人前瞻:目前光象已经推出Phi-Bot X1,并进入了真实工业场景。实际进展情况如何?
张涛:在6月份产品发布之前,我们就已经在一些头部车厂的场景里做效果验证了。
8月份,我们的产品就已经陆续进入之前合作的主流车厂的产线里,包括一些头部国际车企、新能源车企。现在机器人也都在产线里做最后的部署工作。
机器人前瞻:在产线中,有遇到哪些机器人在产线落地的大坑么?
张涛:肯定会有,落地的过程绝对不是一帆风顺的。
首先,从实验环境进入真实生产环境就是一个挑战,两者完全不同。机器人进场后,还会面临长期可靠性、可维护性、系统安全、人机协同安全等一系列问题。此外,机器人还要在真实场景里进行部署、调试和能力打磨。
相比实验室,真实产线会有大量细节需要处理,这也是落地过程中非常重要的一部分。
机器人前瞻:接下来在机器人本体层面,光象科技还会继续重点投入哪些能力?
张涛:下一代的本体正在研发。
可以简单透露一下,我们下一代的本体核心打两个点:
一面对的是全球市场。我们会把这一代本体打造成一个真正可以面向全球工业场景,能规模化落地的机器人。
二是机器人覆盖的场景。我们会在X1的基础上,通过模块化的方式进一步扩展移动性、负载能力和算力水平,从而实现场景上更大幅度的覆盖。
机器人前瞻:相比本体,世界模型会是光象科技更重要的一个技术方向么?
张涛:是的。真正能干活的机器人离不开身体和大脑,缺一不可。
尤其我们认为,今天具身智能真正需要突破的是大脑。世界模型是我们认为在具身大脑这个维度上有价值的技术路径,所以我们会投入比较重的资源去做。
机器人前瞻:光象科技最近也发布了自己的世界模型,相对于目前市面上其他的世界模型,ActEffect跟他们最大的区别是什么?
张涛:我们提到的一个关键词,叫物理原生,这是我们的世界模型的关键。我们强调,模型一定要能够真正像人一样去理解世界底层的物理规律。
物理规律核心的体现,就是因果性。它一定要知道什么样的动作能够导致环境或世界产生对应的变化。
人是因为具备这种物理因果的理解能力,才能采取泛化性的行为。我们希望机器人像人一样,也具备这样的底层能力,支持它做泛化的动作。
机器人前瞻:为什么光象科技能够把物理原生智能这条技术路线跑出来?
张涛:这个技术路线不是今天才提出来的,核心要素来自我们此前长期的探索和丰富积累。
比如,如何对物理状态进行编码;如何把已经被充分压缩的物理规律嵌入;如何通过强化学习自进化,让模型理解和学习底层物理规律。这些问题我们此前一直在持续探索。
回过头来再反思,具身智能大脑到底需要具备什么样的能力。我们发现物理原生是最核心的突破点。于是,我们把过去的工作串联起来,再结合新的思考,形成了物理原生世界模型的理论体系。
我们希望以此系统地回答一个问题:具身智能如何真正获得通用性和泛化能力。
机器人前瞻:光象从一开始就把世界模型作为“物理原生智能”技术路线的一部分,但Phi-WM 1.0 ActEffect其实是在Phi-Bot X1进入产线之后才发布的,为什么会选择这样的时间点推出?
张涛:这个技术能力不是针对我们这一款机器人,也不是针对一两个特定工位。我们希望它能够真正具备的是完全通用且泛化的底层核心能力。
所以模型的发布与我们在产线的落地,二者之前没有耦合关系。两者都是非常重要的方向。
只是正好我们的技术发展进入到了这个阶段。6月份,本体达到了相对成熟和稳定,且有一些场景落地的验证。8月份,模型第一个版本推出,且达到了非常好的一个效果,于是我们就向大家公开。
机器人前瞻:ActEffect不仅要预测“接下来会发生什么”,还要判断“采取不同动作后,状态的变化”,ActEffect这种能力真正带来的核心变化是什么?是让机器人更会规划动作?还是面对陌生任务泛化能力更强?
张涛:所有的具身通用模型,最终要解决的问题都是泛化性。面向陌生场景时,能做到zero shot或者是few shot的泛化。
ActEffect的核心能力,是让模型在底层理解世界的物理因果性,知道不同动作会带来什么样的环境状态变化。基于这种理解,它在面对不同环境和任务时,可以进行更有效的动作和策略规划,从而实现更好的零样本或少样本泛化。
机器人前瞻:ActEffect在训练的过程中,物理原生数据是如何解决的?
张涛:我们提出的物理原生数据,强调的是来自真实物理交互的、多维度的数据。
过去很多机器人训练数据仅仅是采集了图像、视频。在我们看来,这是非物理原生数据。物理原生数据需要机器人在真实或虚拟环境中与世界进行交互,并在过程中采集数据。
这些数据不仅包括视觉、激光雷达等感知信息,还包括机器人本体的关节、角度、速度、位置,以及交互过程中的力、力矩等数据。
所以我们强调的是一套完整的物理原生数据体系。
机器人前瞻:物理原生数据也是光象技术路线里的一部分,李升波教授在WAIC上说互联网视频数据、真机数据等,都可以通过一定的数据重构、时空对齐和质量增强方法,转化为结构一致的物理原生数据。那么对于光象来说,数据的来源是不是已经没有那么重要?真正决定数据价值的是什么?
张涛:我们认为今天所有的数据,对于训练具备足够通用泛化能力的模型而言,都是有价值的。
核心问题还是在于具身智能缺数据,如果具身智能有像自动驾驶一样的海量真机数据,我们今天就不会提这个点。我们希望把现在手头上能够touch到的数据,都充分挖掘出来。
并不是数据来源不重要,而是结合具身智能发展的现实的阶段性条件,我们不得不去充分的挖掘所有可以被利用的数据,让它能够在模型训练的不同阶段体现价值。
核心不在于用什么数据,而在于怎么用。需要明确各类数据的能力分工、训练阶段和配比。例如,互联网视频及无动作标注的Ego数据用于建立世界先验;带动作标注的Ego、UMI和真机遥操作数据用于学习状态转移;仿真数据则用于生成干预、失败和反事实样本。
四、采用端到端交付,已落地近10家车企
机器人前瞻:光象科技目前跟车企的合作是以卖机器人为主还是解决方案为主?或者是什么其他合作方式?
张涛:目前最能够落地的方式是端到端为车企客户解决问题。我们不是单纯卖一个机器人,而是交付一整套能够在具体工位实现功能的系统,包括机器人本体、模型等。
现阶段,具身智能的产品形态和商业模式还没有完全固化,大家都在探索。通过端到端交付,才能让客户真正理解具身智能的可用性和价值。等这个阶段逐步成熟之后,商业化模式可能会更加丰富,比如机器人劳动力租赁,或者交付机器人本体后,通过后续服务和能力升级持续为客户创造价值。
但现阶段,第一步一定还是端到端交付。
机器人前瞻:从目前实际合作的反馈来看,客户最看重光象科技哪些能力?
张涛:客户其实已经经历了一个完整周期。去年年初,具身智能行业很火,很多头部机器人公司都有很炫酷的demo,客户也愿意拥抱新事物、积极合作。但真正把机器人放进工厂后,他们发现面对一些并不复杂的问题,机器人却未必能做成功,因此实际效果和预期存在落差。
光象从客户那里得到最直接的反馈就是,我们的机器人真的能够帮他们解决问题,能够在真实产线上完成实际工作。
最近我们和一家头部国际车厂合作,他们的合作伙伴此前也经历过类似的过程。看到我们的现场表现后,对方反馈说,我们的机器人和他们之前看到的表现完全不在一个level上,能力有明显提升。对客户来说,这也重新建立了他们对具身智能落地的信心。
机器人前瞻:目前合作的车企大概有多少了?
张涛:其实还蛮多的,实际上我们刻意做一些前期控制,所以并不是所有的车企都会做非常紧密的合作。目前来讲,大概有不到10家。
机器人前瞻:汽车是一个非常大的产业,但这两年汽车内卷严重,也导致汽车的供应链企业都不怎么赚钱。光象科技跟车厂也合作了一段时间,回头来看,汽车还是一个很好的具身落地的赛道么?
张涛:首先,我们的目标并不是只做汽车,最终的目标是做通用泛化的具身机器人,从完整的工业赛道,再拓展更多的领域。汽车是一个非常好的场景,这个场景会帮我们筛选落地工作的价值。
具身机器人刚开始能力有限,如果只从“我现在能做什么”出发,很容易找到一个能落地的场景,但未必具有真正的商业价值。比如搬箱子,机器人可能能做,但市场上已经有AGV、无人叉车等更成熟、更简单的方案,具身机器人未必是最优解。
汽车场景的特点是规模大、附加值高,而且对技术和工业标准要求高。过去很多先进的自动化设备、工业机器人和管理理念,都是先在汽车行业得到应用和验证,再向其他行业推广。
所以我们选择汽车,一方面有把握地确认汽车制造在经过充分的自动化升级迭代之后,遗留的场景是能够真正体现具身机器人价值的;另一方面,汽车制造本身具有很强的示范效应。能够在这样严苛的工业环境中做好,再基于成熟的产品和标准向其他行业复制,会相对顺畅。同时,汽车市场本身也足够大,单一场景的规模化复制就能够带来商业价值。
所以对我们来说,汽车是把具身智能推向更多行业的一个起点。

五、具身智能还在寻找真正的“通用大脑”
机器人前瞻:您在最近的采访中,也谈到硬科技创业的成败,往往不取决于技术是否领先,而取决于是否踩中了产业成熟的节奏。那您觉得目前具身智能是处在产业成熟的节奏上么?具体体现在哪些方面?
张涛:我觉得具身智能是比较典型的复杂的事情,不能把它定义为单一的技术。
具身智能是一个完整的技术体系,在这里面可能有人做世界模型、有人做VLA、有人做家居服务的机器人、有人做工业场景的具身机器人。
我们无法判断整个具身智能行业是不是正好在这个节奏上。但我们的判断是,以今天具身智能整体的技术能力,在未来的1到3年内,会有部分场景能快速落地、复制并推广,且产生商业价值。
机器人前瞻:今年有世界模型赛道涌入不少资金,也有越来越多数据、本体等企业开始做世界模型,你怎么看这一轮世界模型热潮?
张涛:世界模型这个词太大了。首先这是好的概念,但同时又是不聚焦的概念,世界模型听起来让人觉得包罗万物,什么东西都可以往里装。现实的情况也是很多东西都往里装。
我们的理解是要跳出这个词本身,搞清楚最终要达到什么目的。比如我们最终追求的是要通用、泛化的具身大脑,那么真正能够支持这个目标的,才是真正有价值的世界模型。
机器人前瞻:不同企业对世界模型的理解和技术路线并不完全一样,有隐式、因果等等,您认为觉得这些路线会走向融合吗?
张涛:我觉得不会。大家的目标不一样,如果做视频生成,是为了服务于游戏、影视行业。这条技术路径就是以大量的互联网视频数据作为输入,用一套大模型自回归的训练方式生成。
但如果是服务于机器人,我觉得完全不够。服务于不同的目标,最后会衍生出不同的路径。甚至到后面,我甚至觉得不能再用“世界模型”一个大框把所有东西都装进去,还是要区分服务的最终目标。
机器人前瞻:您觉得世界模型会不会成为未来具身智能公司的标配?
张涛:不好说。首先做世界模型这件事,需要比较大的投入,需要海量的数据、充分算力,以及需要有底层的技术能力去支持整个模型架构和训练。
我觉得不是所有人都会去做,不是所有人都能做得好,也不是所有人都需要去做。只有真正追求做通用泛化的具身大脑公司会持续投入。
机器人前瞻:目前有一种说法,就是行业正在进入“洗牌期”,您觉得具备哪些特质的公司能“活下来”?
张涛:历史上其实是无数次重演一个规律,一开始热门赛道会有大批资金涌入,催生出一大批的公司,这里面可能有少量的公司活到下一次行业爆发。真正能够活到未来的,是一开始对事情本身的周期性有充分的认知,并且有非常明确且坚持的业务判断,有比较好的商业闭环能力。
所以我觉得在今天这个时间点上,如果能够做到这一点是有机会的。如果仍然停留在概念、demo或者比较虚的层面上,可能会比较危险。
机器人前瞻:未来三到五年,您希望光象科技会成为一家什么样的公司?到时候您觉得光象最核心的产品或能力是什么?
张涛:具身智能是一个长期赛道,但未来3到5年,也会在一些行业方向、业务方向上看到非常实质性的落地,以及具身智能带来的突破性影响。
在这个过程中,我们希望光象科技能够在汽车制造和工业制造等方向起到引领作用。3到5年之后,我们希望具身智能能够在这些场景中实现规模化部署、被行业真正接受,让光象成为新生产力的代表。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”




