


机器人前瞻(公众号:robot_pro)
作者 | 刘俐杉
编辑 | 许丽思
机器人前瞻7月20日报道,昨天,大晓机器人在2026世界人工智能大会现场,正式发布原生行动一体化开悟世界模型3.1(Kairos 3.1),并面向各行业开源。
作为融合生成智能、物理智能与认知智能的行动一体化世界模型,Kairos 3.1以原生统一架构打通理解、生成、预测技术壁垒,构建“理解-推演-执行-反思” 全链路自进化智能闭环,标志着具身世界模型正式从单一能力突破迈向产业落地的完整闭环阶段。
在发布会上,大晓机器人提出具身世界模型第一性原理,依托多模态高密度信息萃取、控制充分状态锚定,在复杂不确定环境中最大限度降低机器人行动试错成本。
基于具身世界模型第一性原理,Kairos 3.1依托混合Transformer架构与共享混合注意力机制,将视觉观测、语言指令、力触状态、策略轨迹等多维具身数据压缩进统一隐空间,形成高密度表征向量,从底层实现三大能力的原生融合。
同时,该模型凭借自主反思进化能力,机器人可在执行失败时主动调整动作策略。
在推理能力方面,Kairos 3.1 8B模型推理延迟仅125毫秒,达到经典VLA模型水平,相较于同类型世界模型Cosmos 3 Nano648毫秒的延迟,Kairos 3.1推理效率提升达52倍。
一、世界理解、状态推演、动作预测三位一体
当前全球具身智能行业快速迭代,世界模型沿表征式、生成式、交互式、理解生成预测一体化式四大流派演进,前三大流派始终面临“能力强、难落地”的困境,难以满足产业落地对世界理解、状态推演、动作预测的一体化需求。
在发布会上,大晓机器人董事长王晓刚提出,具身智能行业的痛点在于,数字世界模型失误仅影响图文生成,而物理场景下智能体预判偏差将产生不可逆真实损失。”
▲ 大晓机器人董事长王晓刚(图源:大晓机器人)
由此,大晓机器人提出具身世界模型第一性原理,依托多模态高密度信息萃取、控制充分状态锚定,在复杂不确定环境中最大限度降低机器人行动试错成本。
该原理的底层逻辑可概括为:机器人掌握的关键信息越丰富,对控制充分状态的判断就越精准,最终执行任务时的行动代价就越低。
基于该底层逻辑,该模型的核心技术突破,在于以原生统一架构将世界理解、物理生成、动作预测三大核心能力深度融合于同一技术底座,构建出可自进化的智能闭环系统。
先通过世界理解完成长程任务拆解与环境评估,再在平行空间开展物理因果推演与多策略演算,筛选输出最优动作预测,同步完成过程分析与结果评估并将状态反馈模型,全链路驱动智能持续跃迁。
从底层架构设计来看,Kairos 3.1打造了“理解-生成-预测”共享隐空间。
该模型依托混合Transformer架构与共享混合注意力机制,将视觉观测、语言指令、力触状态、策略轨迹等多维具身数据压缩进统一隐空间,形成高密度表征向量,从底层实现世界理解、状态推演、动作预测三大能力的原生融合。
三类能力并非独立模块的简单拼接,而是共享同一套特征表征与注意力机制,通过前馈神经网络、层归一化与条件交叉注意力的协同调度,实现信息的无损流转与高效联动,为全链路智能闭环提供了原生架构支撑。
在数据采集方面,大晓首次提出“信息密度定律”:数据的价值不在数量堆叠,而在信息密度。会改变行动结果的信息,就是有价值的信息。
在这一定律下,L1-L2级数据仅能支撑基础预训练,L3-L4级数据止步于已知任务的拟合。唯有当数据迈入L5,深度融入三维力触觉、失败恢复轨迹和开放场景变量时,世界模型才真正跨越了“描述”,获得了泛化、反思与自进化的能力。
基于此,大晓发布以人为中心的环境式数据采集方案2.0,凭借全维感知、深层解构、统合映射的全新范式,构筑起开悟世界模型反思与进化的数据底座,为机器人的认知跃迁输送数字“养料”。这也正是第一性原理中“多模态高密度信息萃取”在数据层面的具体实现。
二、ACE-BRAIN-0.5已累计斩获十二项全球SOTA
在世界理解维度,ACE-BRAIN-0.5作为空间理解核心底座,为Kairos世界模型筑牢空间根基。该底座具备三层核心理解能力。
空间层面,ACE-BRAIN-0.5可精准识别物体部件位置、机械臂与环境的相对位姿,深度解析复杂空间关系。
任务层面,该底座依托时空记忆与思维链能力,可将长程任务拆解为十余个操作步骤,自主生成时序合理的全局执行方案。
状态层面,该底座具备任务状态追溯与自我评估能力,可全程追踪执行进度、实时核验每一步操作结果,精准定位失败节点并触发动态纠错。
▲ 开悟世界模型端侧本体演示抓取物品(图源:大晓机器人)
截至目前,ACE-BRAIN-0.5已累计斩获十二项全球SOTA,空间理解、导航决策、操作执行、进度评估等全维度能力跻身全球第一梯队。
在物理生成与推演维度,Kairos 3.1构建了高保真、可交互的数字平行世界,为机器人的“脑海推演”提供了真实可信的仿真底座。
Kairos-HomeWorld和Physx-omni在全球首次实现全屋生成与物体全交互,内置30万套中国住宅平面图、5000 个全屋仿真场景与 8700 个覆盖几何、绝对尺度、材料力学、功能属性等六大物理属性的3D资产,高度还原中国家庭居住特征。
这套生成能力以物理真实性为核心,所有物体均遵循真实物理规则,机器人可与家居物品开展自由交互。
在动作预测维度,Kairos 3.1实现了从“推演结果”到“最优行动”的精准输出,直接支撑真机的可靠执行。基于统一隐空间的生成与理解能力,该模型可在平行空间同步推演多条动作轨迹。
例如执行开冰箱指令时,该模型从同一初始状态出发,同步生成多条候选动作轨迹,预演不同方案的执行结果与行动代价,会从失败方案、高代价动作与最优策略中筛选成功率最高、执行成本最低的路径输出真机。
该预测能力可支持高自由度的全人形控制,既能完成桌面收纳等长程复杂任务,也能针对精细操作启动深度思考模式,甚至支撑全身协同的复杂作业,实现从认知决策到本体控制的端到端打通。
▲ 开悟世界模型端侧本体演示收纳物品(图源:大晓机器人)
三、Kairos 3.1 8B模型推理延迟仅125毫秒
端侧可部署的实时推理能力与自主反思的自进化能力是具身世界模型走向真实场景落地的关键进阶。Kairos 3.1在保持世界模型高智能上限的前提下,突破了高延迟、难落地的行业瓶颈,同时构建起“执行-评估-反思-优化”的完整智能闭环。
长期以来,世界模型普遍存在参数量大、推理链路长、延迟高的痛点,Kairos 3.1依托自研的具身世界模型高性能计算引擎KairosRT,从软硬件协同层面实现五大技术创新。
通过高性能模型结构与融合计算优化计算链路,采用模型混合精度量化压缩算力开销,结合算子最优切分尺度搜索提升硬件利用效率,辅以多流并行异构调度与异步动作运行机制,最终实现了世界模型的端侧实时推理。
在性能方面,在NVIDIA Jetson Thor平台BF16精度下,Kairos 3.1 8B模型推理延迟仅125毫秒,依托自研KairosRT高性能计算引擎,在保持世界模型高智能上限的同时实现端侧实时推理。
该模型推理速度达到经典VLA模型水平,较参数量更小的Pi0.5 3.3B模型更具优势,相较于同类型世界模型Cosmos 3 Nano6486毫秒的延迟,Kairos3.1推理效率提升达52倍。
这一成果在保留世界模型更强认知、推演与规划能力的同时,达成了端侧部署的实时性要求,为真机离线运行、低时延控制提供了核心支撑,也让高自由度全人形控制、精细操作等复杂场景的实时响应成为可能。
自主反思的自进化能力是Kairos 3.1的另一项核心进阶。真实作业场景充满不可预知的变量,单次推理与预设策略难以覆盖所有突发状况,机器人能否自主感知失败、定位问题并修正策略,直接决定了任务的完成率与环境适应性。
基于一体化的理解、生成、预测架构,Kairos 3.1构建起完整的状态反思机制。
机器人执行任务过程中,任务评估器会全程核验执行状态,一旦出现操作失败,系统会精准定位问题节点,触发反思机制并调用平行空间推演能力,重新生成多组候选动作轨迹,筛选最优方案后再次执行。
以开冰箱取水任务为例,机器人初始采用三指操作策略执行失败后,系统自主反思判定为发力不足,随即在平行空间生成多组操作轨迹进行模拟推演,最终切换为四指操作方案成功完成开门动作。整个过程无需人工干预,机器人自主完成全链路闭环迭代。
▲ 开悟世界模型端侧本体演示打开冰箱(图源:大晓机器人)
端侧实时推理让自主反思闭环得以在真机上高效运转,自主反思则让端侧模型具备了持续进化的能力。
结语:从单点突破到生态共建
开悟世界模型3.1实现“理解—生成—预测”一体化的反思自进化智能闭环,让机器人在物理世界中拥有了思考与纠错的能力。但单个模型的突破,远不足以撑起一个产业的规模化落地。
此次,大晓机器人发起了“世界模型云生态共建”,集结了百度智能云、阿里云、华为云、腾讯云、商汤大装置等算力巨头,意味着开悟世界模型正在从一项技术成果,演变为一个可被行业广泛调用的公共基础设施。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”