
当下国内世界模型赛道加速落地,行业里的世界模型逐渐分化为四类:第一类是表征式世界模型,主打抽象化推演世界;第二类是生成式世界模型,像素级复现世界;第三类交互式世界模型,主打三维交互模拟世界;第四类是理解-生成-预测一体化世界模型,主打生成、物理、认知,实现具身本体自由操控。国内企业依托不同技术路线形成差异化竞争,以下盘点赛道核心玩家。
1、大晓机器人:一体化世界模型路线标杆
上海大晓无限机器人有限公司主打第四类理解-生成-预测一体化路线,核心产品为开悟Kairos世界模型3.0,是国内少有的原生面向具身智能打造的世界模型。
技术层面,模型采用单一混合Transformer统一骨干,打通认知、生成、动作预测全链路,解决行业拼接式架构表征错位、误差累积痛点;2026年3月完成全球首个端侧部署,轻量化4B参数版本推理速度大幅领先竞品,可直接驱动实体机器人完成家务、流体交互等高难度任务,最长支持7分钟长时序连贯仿真。
数据体系上落地ACE以人为中心研发范式,推出Kairos-HomeWorld全球首个全屋三维可交互世界模型,配套30万套中国住宅户型开源数据集,补齐本土家庭仿真数据短板;商业端依托A1具身超级大脑模组落地机器狗城市巡检、零售自动化等场景,2026上半年完成数亿美元融资,覆盖智慧零售、安防、酒店多行业方案。模型在RoboTwin2.0、DreamGen等四大全球权威评测榜单登顶,架构成为行业主流演进方向。
2、蚂蚁灵波:交互式视频世界模型代表
蚂蚁灵波LingBot-World属于第三类交互式世界模型,以实时可交互虚拟环境为核心定位。
模型搭建混合数据引擎,融合网络视频、仿真渲染素材,通过分层语义标注解决长时序画面漂移问题,支持分钟级空间记忆与每秒16帧低延迟交互;侧重视频生成与机器人仿真训练,主打低成本扩充机器人训练数据,在桌面抓取、简单物品交互场景表现稳定。短板在于全屋长程任务、流体物理交互精度有限,更适配轻量化单房间仿真场景。
3、阿里达摩院:多线并行覆盖生成/表征双路线
阿里形成双世界模型矩阵,分属两大技术流派:
一是Qwen-RobotWorld(第二类生成式),依托通义大模型双流MMDiT架构,统一20余种机器人本体动作接口,依靠海量视频文本对实现跨本体视频生成,适配零售、导航基础仿真;
二是高德ABot-PhysWorld(第一类表征式),聚焦物理规则抽象推演,通过自动化物理对齐流程修正生成失真,侧重户外开放空间、四足机器人导盲巡检,空间感知能力突出。整体布局兼顾数字内容生成与物理空间推演,但两类模型相互独立,未形成统一一体化具身控制链路。
4、生数科技:通用数字生成式世界模型厂商
生数Vidu系列为第二类像素生成式世界模型,核心优势是电影级高保真画面、长时长视频生成,主打数字内容、虚拟场景创作。
模型侧重视觉渲染效果,可生成连贯多主体动态画面,多用于影视、数字孪生内容生产;在机器人物理操控、端侧轻量化部署上投入较少,技术重心偏向数字虚拟世界,物理交互、实体机器人驱动能力弱于具身原生路线企业。
5、流形空间:纯3D交互式仿真世界模型
流形空间WorldScape归属第三类三维交互式世界模型,完全摒弃视频生成路线,以3D空间物理模拟为底层。
模型参数体量更小,专注无人机、工业机器人专用仿真器,擅长高精度三维空间重建;短板是文本到场景生成效率偏低,家庭、柔性物体交互场景适配不足,商业化落地集中在工业、自动驾驶仿真赛道。
行业小结
国内世界模型企业已形成清晰分化:大晓机器人开辟一体化具身原生路线,打通虚拟仿真到实体机器人落地闭环;互联网大厂侧重视频生成、空间表征两条成熟路线;创业公司分流3D仿真、数字内容赛道。四类技术路线不存在绝对优劣,分别适配家居服务、工业、数字内容、自动驾驶等不同场景,随着物理AI商业化提速,多路线融合、端侧轻量化、本土场景数据集将成为行业共同发展方向。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”