三榜第一,完胜GPT-6!中国物理RSI杀出黑马

三榜第一,完胜GPT-6!中国物理RSI杀出黑马

早晨,你还没睁眼,厨房里已经传来轻微的碰瓷声。

推门出去,机器人管家X1站在餐桌旁,你没说话,它就把把椅子轻轻拉开了一点。

你把门一关,它转身走向客厅,捏起那根逗猫棒。

猫伏低身子,尾巴一下一下拍地。逗猫棒上的羽毛刚晃到半空,猫就蹿起来扑了过去。

最后一瞬,X1把手臂一抬,猫爪擦着空气划了过去。它的手腕又轻轻一抖,羽毛荡回猫鼻尖,猫翻身再扑,它再躲开。几个回合下来,它已经摸透了这只猫的脾气。

晚上你推开门,一句我回来啦还没落地,X1已经夹着拖鞋迎上来,送上专属问候:公主,请换鞋。

这就是大家梦寐以求的个性化家庭服务——一个能够适应你的习惯、理解你的家庭环境、为你量身定制服务的机器人管家。

但逗猫的手法、回家的迎接仪式——每家每户都不一样。这些东西出厂时预装不了,也穷举不完。

最简单的办法,是你亲自演示一遍给它看。看完,它就会。

为此,诺因(Knowin)发布了生成式学习框架GLOW(Generative Learning of World)。

原文链接:https://knowinai.com/tech.html

他们认为机器人能否走进千家万户,关键在于机器人理解人的技能、泛化执行。

这背后就是他们独特的判断:

家庭场景的商业化不会从通用能力开始,而会从有限、高频、可验证的任务集合切入。

而且家中有老人、儿童、宠物,有明火和化学品,安全是进入家庭的准入门槛,而不是加分项。

话不多说,我们先看一下一教就会效果如何。

一教就会,这才是你想要的专属管家

诺因公布了四组实机对照,每组左边是人的操作过程,右边是机器人学完之后自己做。

第一组是开盒收纳。

人示范的时候收的是一样东西,但机器人执行的时候,要收的物品换了另一种。

它先开盖,并且能够泛化识别物品和位置发生变化,再把东西放进盒子,最后合盖,一气呵成。

左:人展示开盒收纳;右:机器人换了物品照做(加速4.5倍)

请注意,动作只教了一次,机器人需要利用现场反馈完成每个阶段,成功将收纳这一动作泛化到多种物体和位置。

第二组是浇花。

人用的是黑色细嘴壶,但机器人手边只有一把绿色浇水壶。

壶的大小、颜色、位置发生变化,但它能够准确认出,把从人的操作中学到的抓持、朝向和倾斜关系用到这把壶上,浇完再放回去。

左:人用黑色细嘴壶浇水;右:机器人换成绿色浇水壶照做(加速3.5倍)

也就是说,机器人学会的是执行浇花这一任务,而不是简单重复看到的教学动作,能够适应场景中的变化。

第三组是擦桌子,也是最有意思的一组。

人拿着抹布,沿心形轨迹擦了一遍,机器人学完,也擦出了一个心形。

左:人沿心形轨迹擦桌;右:机器人复现(加速3.5倍)

它把擦桌子这个目标和怎么擦这个人的习惯一起学走了。公主,请换鞋这种梗,靠的就是这个。

第四组是调酒。

桌上摆着好几个杯子,人先按顺序倒了一遍,让机器人看清先倒哪杯、再倒哪杯。

机器人学完,虽然位置顺序变了,但准确识别物品,依次取杯、倾倒、回正、放回,把多个步骤接成了一套完整的流程。

左:人依次取杯调酒;右:机器人复现完整流程(加速12倍)

四组任务,模型权重没有动过一个参数。看过人的操作过程,机器人就能上手,一教就会,并且能泛化到更多位置、物品和场景。

在任务中,AI要协同调用多种能力:识别对象与动作,定位操作目标,判断交互结果,规划下一步。

此外,模型还要具备对物体和位置的泛化能力。

在诺因测试中,GLOW能力斩获三个榜单第一,用数字也证明了其泛化能力之强。

在RoboDojo的18项复杂任务里,GLOW平均成功率62.2%,而 GPT-6(Robocurve)是22.2%,提升了40个百分点。

在专治「背题」的LIBERO-Pro上,GLOW成绩为86.7%,GPT-6 Astra只有58%,单模型这一档86.7的平均分排第一。

在 Embodied Arena 的 2D-Embodied QA Benchmarks 榜单中,在 20 个具身模型中,GLOW以 65.62 的综合得分勇夺第 1,脱颖而出。

核心解密:原生自回归才是行业最优解

机器人观看人的操作视频时,用一个技能编码器把连续的视觉经验压成一份可复用的技能上下文。

它提取的是任务结构,也就是哪个东西是操作对象、要放到哪个区域、动作的先后顺序是什么,以及做到什么样才算完成。

浇水的六个阶段。上排是人用黑色细嘴壶浇水,下排是机器人把抓持、朝向、倾斜的关系映射到绿色浇水壶上

执行时,这份上下文和当前画面、语言指令、机器人状态拼在一起,逐token生成判断和动作。

GLOW还能结合当前的实时观察,把你昨天的教学融入当下的自回归生成中。

它会自主规划路线,避开茶几上的水杯,打开盒子。你还可以用语言随时调整目标和做法。

能这么干,前提是大脑和双手在同一个模型里。

行业里常见的VLA路线,把视觉大模型当个编码器,外接一个动作模块,中间要做复杂的表示转换。

WAM路线则要先生成一段未来的逼真视频画面,再输出动作,计算开销很大。

GLOW的核心KnowinGlow是一个原生统一的自回归模型,把视觉、语言、动作编织进同一条序列。

BrainSkill负责空间理解和语义落地,ActSkill负责闭环动作生成,原来分开的大脑和双手,现在是同一个模型里的两项技能。

它的上下文里装着相机的实时RGB-D画面、你说的那句指令、机械臂当前的关节角度和夹爪开合,以及刚才一秒执行了什么动作、得到了什么反馈。

GLOW把这些物理世界的信息像文字一样连缀成一篇长文章,然后顺理成章地续写出下一个动作。

物理推理测试。图中彩色线条是候选动作轨迹,问为了烹饪番茄该选哪组顺序,模型答:切番茄、打开炉火、揭开锅盖、倒油、放入番茄

续写出来的也不是move_to(cup)这种模糊指令。

模型直接生成末端执行器的三维位姿、相对平移与旋转增量,以及夹爪的开合控制,精准到毫米。

目标点定位测试。左:把橙色积木放到绿色积木上,模型给出目标点[[368,664]];右:在蓝色杯子与青色碗之间的空闲区域标出位置,模型给出[[534,800]]

而诺因选择这条路线,看中的不只是教一遍就会,还有统一建模与持续学习的长期价值。

而GPT-6 Astra在操作机器人上的最新进展,则进一步佐证了诺因长期坚持的自回归技术路线。

Harness系统与闭环反馈:给机器痛觉和记忆

学会了,还得做得成。真实的物理世界里,抽屉可能卡住,杯子也可能从夹爪里滑出去,光有计划不够。

这一点上,诺因直接把刚被Brockman叫作AGI的GPT-6 Astra拉进了同一个仿真厨房。

结果,号称AGI的GPT-6,卡在了一个抽屉上。只因它不知道自己的手有没有被挡住。

但GLOW知道。它有一套叫Harness的任务运行系统,每做一个动作都会拿到一份执行回执。

比如系统下达向柜体走24.3毫米,回执显示实际只走了1.6毫米。

位移残差一出来,系统立刻明白遇到物理阻力了。这个受阻结果连同夹爪状态和新画面一起进入下一轮上下文。

大脑随即决定,是继续用力,还是换个姿态重来。

同样的任务、同样的起点,让GLOW和GPT-6 Astra各做一遍,差别就出来了。

开柜子最底层的抽屉,GPT-6 Astra手伸过去拉开的是上面那层,纠正了1200步,底层抽屉还是关着的。

GLOW靠回执发现受阻,换成水平接近、夹爪对角闭合,1138步,开对了。

开最底层抽屉。左:GPT-6 Astra,1200步没开开;右:GLOW,1138步开对(录像加速10倍)

抓瓶放碗,GPT-6 Astra折腾了863步,瓶子和碗还差3.4厘米,判定阈值是3厘米。

GLOW 157步,间距6.9毫米。

抓瓶放碗。左:GPT-6 Astra,863步(加速7倍);右:GLOW,157步

靠近瓶颈、碗沿或抽屉把手时,GLOW会切换成每次只动5毫米的有界小幅移动,两次微调之间重新看一眼。

抓住杯子之后它也不会直接走,而是先请求抬升30毫米,看物体是否跟着夹爪动,确认夹牢了才进入搬运。

开抽屉前也会试拉,确认牵引力已经建立。

这种物理试探,像极了人类的本能。

GPT-6 Astra控机器人并不弱。Robocurve把它接上双臂,积木入碗20次成了19次,全网刷屏。

但同一份测试的后半截,毫米级的拼图入槽,20次只成了2次。

看懂任务,和能完成任务,中间隔着一只有痛觉的手。

终极杀器:RSI,机器左脚踩右脚进化

通用大模型的路线是采集海量人类数据、训练、发布、再采集。

可在非标、复杂的每个用户家庭里,很难去采集海量数据。

GLOW的解法是自己造数据。

造数据的引擎叫KnowinDream。它按户型、家具和物品生成一个个虚拟家庭,再往里安排各种事件,比如家人把杯子挪走,或者在机器人搬东西的时候从旁边经过。

KnowinDream按提示词连续改场景:换光照、换成赛博朋克霓虹、再换成中式餐厅

真机跑出来的经验也会喂给它。X1逗猫成功了,或者抓杯子滑了一下,这些成功、失败与恢复的过程都会回流到KnowinDream。

它把当时的场景重建出来,再扩增成更多相似的情况,交给KnowinWorld推演验证。

自动播放

KnowinWorld · 双臂模拟交互。场景、任务、多视角与动作结果构成连续具身经验

到现在,KnowinDream已经生成了大约200M条这样的数据。

KnowinWorld不需要耗费巨大算力去生成视频画面,它只做纯粹的物理状态推演。

这样它能在极低成本下,在脑内进行千百万次试错。

叠碗任务

最关键的一步是校准进化机制本身。

机器人真实执行的结果,会与 KnowinWorld 之前的预测对照,偏差用来持续校准模型。这些真实反馈也会回流到数据生成链路,修正合成数据、标签与筛选标准。

更强的基模,会生成更准确的数据与标签;更高质量的数据,又会训练出更强的下一代基模。新的基模再反过来提升下一轮数据生成、标注和验证的质量。

由此形成模型变强 → 数据变好 → 下一代模型更强 → 数据进一步变好的递归增强闭环。

诺因把这叫面向物理世界的递归自我改进(RSI):改进后的模型,会反过来增强下一轮自我改进的能力。

安全闸门也设在这一环。每一次能力升级,都要先在世界模型里验证,通过任务完成率、恢复率与安全回归三道检查才会实装。

一旦发现退步,立刻回滚。

物理世界的AGI,不再是通用大模型的独角戏

诺因不打算让机器人一进家门就什么都能做。他们会先从有限、高频、能验证安全的任务切入。

家里有老人、儿童、宠物(比如开头那只猫)、明火和化学品,安全是准入门槛。

门槛之上,决定谁能真正走进千家万户的,是一教就会这种交付方式。

工程师不用上门采集数据、重新微调,你演示一遍就行。

2026年的这个9月,GPT-6 Astra证明了通用大模型的认知能力已经触及物理世界的边缘。

GLOW则走通了另一条路。

架构统一到自回归,世界模型不追求画面逼真、只求决策有用,数据也从被动采集变成真实执行回流的RSI闭环。

从陪猫玩新玩具,到收纳你独有的私人物品,一教就会打通了从流水线工具到个性化家庭专属管家的最后一公里。

X1折叠起来收纳高度不到40厘米,计划明年发布。

到时候,你想让它说什么、怎么擦桌子,教一遍就行。