00后浙大博士把4D世界模型首次塞进手机

新智元报道

这个假期,当大家在朋友圈晒国旗、晒旅行、晒美食的时候,华为选择在国庆节这一天扔出了重磅产品——
华为Mate 90系列正式发布,全系搭载新一代麒麟芯片,鸿蒙7加持!
发布会上有太多值得聊的东西,但有一个细节——一款叫「摸小宠」的鸿蒙独占应用,惊艳地亮了个相。
它能干啥?你掏出手机,拍几张你家猫的照片,上传。
几秒钟后,你手机里就多了一只「猫」。
不是那种只能转圈圈的3D模型猫,而是一只有空间结构、会动、能从任意角度看、你走近它它还在摇尾巴的4D数字猫。
你可以绕着它转,它就在那里,在你的手机屏幕里,像真的一样。
听着是不是有点科幻?
这是4D世界模型第一次真正跑进了手机应用。
而做到这件事的魔芯科技,也成为全球范围内率先将4D世界模型推进到产业应用落地的公司。背后的技术叫MoWorld。

一张照片,「走进去」的世界
过去我们说AI能生成图片,比如你给Midjourney一句话,它给你一张图。
后来AI能生成视频了,Sora们开始造出能动的画面。但本质上,那还是一段录像带,它的视角是选定的,不会变,你不能走过去看看那栋建筑背后长什么样。
而MoWorld做的事情,是把一张照片变成一个「可以走进去」的世界。或者用更技术的话说,叫原生重建4D世界模型,它从一开始「原生」生成的就是一个4D空间。
你给它几张普通手机拍的照片,甚至几段随手拍的视频。MoWorld不会简单地「复制」画面,而是去理解这些画面背后的空间结构——那堵墙在哪儿?那张桌子离镜头多远?桌子后面被挡住的部分长什么样?
然后,它会基于这种空间理解,把平面的图像扩展成一个三维空间。你可以在这个空间里前进、后退、转弯,看到照片里没有直接展示过的角度和区域。
这就是「摸小宠」这个小应用背后真正厉害的技术底座。
你上传几张猫的照片,MoWorld先理解猫的三维形体结构,真正从有限的视角信息里推算出猫的空间结构、毛发纹理、体型比例。
然后,它还理解猫正在做什么。
猫在摇尾巴?好,当你切换到侧面视角的时候,尾巴的摇晃动作依然是连续的、符合空间逻辑的。你绕到猫的背后,猫不会突然僵住。它该怎么动还怎么动,只是你观察的角度变了。
这就是所谓的「4D」——三维空间加上时间和变化的维度。
模型不仅知道物体在哪里、长什么形状、从不同角度看应该是什么样子,还知道物体正在怎么运动、动作在不同视角下怎么连续呈现、场景随时间发生了什么变化。
如果用一个更直观的比喻:以前的AI生成内容是「给你看一部电影」,而MoWorld生成的,是一个「你可以走进去逛逛的片场」。
最能展示这种能力的,就是所谓的「子弹时间」效果。
就像《黑客帝国》里Neo躲子弹那个经典镜头:模型根据少量图像恢复场景和物体的空间关系,从不同角度生成连续、稳定的环绕视图。
不同的是,这里不需要几十台摄像机,几张手机照片就够了。

不只是宠物:
应用落地才是真正的护城河
魔芯科技最值得关注的一点,恰恰是它在应用落地上的领先——摸小宠只是其中一个消费级入口,MoWorld已经在多条产业线上同步推进,多个合作项目进入技术验证和具体实施阶段。
影视和游戏。 传统的影视制作流程中,一个场景需要经历建模、贴图、灯光、动画等多个漫长环节。
MoWorld可以把前期场景搭建周期大幅压缩,快速生成场景资产,支持自由运镜、天气切换、物体编辑。
一个场景可以生成多个故事走向的版本,分镜预演和概念验证的成本陡然下降。
在游戏产业,500FPS以上的资产渲染能力和移动终端的高帧率运行,有望降低互动世界对高端显卡的依赖。

室内空间4D建模
具身智能训练。 以前训练一个机器人抓取、避障、搬运,需要在真实环境里反复试错。设备损耗、场地成本、还有碰撞伤人的安全隐患。
MoWorld搭建的数字仿真训练场,可以让机器人在虚拟空间里完成所有动作演练,碰撞和失误只产生虚拟损耗,支持高频次复盘迭代。
加入物理属性后,机器人还可以在仿真环境里体验重力、碰撞反馈和物体交互。
自动驾驶。 MoWorld可以在3D空间中调整道路环境、交通参与者和物体运动状态,特别适合生成那些现实中成本高、风险大、难以重复采集的长尾场景。例如雨雪天气、坑洼路面、突发事件。3D/4D资产可以方便地调整、复用和重新渲染,提高训练数据的生产效率。

自动驾驶训练场景
工业数字孪生。 工厂产线、矿山等场景中,MoWorld可以将真实环境快速转化为空间资产,用于设备布局调整、改造方案预演、远程培训和异常场景模拟。
不再需要反复人工建模,现实场景到仿真数据的转化效率大幅提升。

矿山建模
城乡规划与文旅。 虚拟游览、沉浸式内容生产、方案展示、空间重建,这些以前需要大量人工搭建的工作,MoWorld可以用算法来加速。

文旅场景重建
MoWorld的价值不是单纯地「画面更好」或「帧率更高」,而在于它能以低成本方式生成高质量、可复用的3D/4D空间资产,让这些资产真正流入产业系统被反复使用。
这是一条从「技术能力」通往「产业效能」的桥梁。

端云协同:
6亿参数模型怎么塞进手机的
这些产业应用能铺开,离不开一个前提:MoWorld跑得动、跑得起。
听到这儿你可能会问:这种级别的AI运算,不得在数据中心里烧几百张GPU才能跑?手机?开什么玩笑?
确实不全是手机在算,摸小宠背后是一条端云协同的链路:照片上传到云端,昇腾NPU上的扩散模型先生成高质量3D高斯模型——这一步算力需求大,交给服务器。
然后魔芯科技做了一个「瘦身版」MoWorld-2.0-Flash,约6亿参数,经过量化裁剪和算子适配,直接跑在Mate 90的麒麟芯片上。最终渲染呈现也在手机端完成。
国产算力训练,云端生成,端侧渲染。
说着轻巧,做起来极难。
把一个大型服务器上的世界模型塞进手机,不是压缩打包那么简单。
算子要适配麒麟架构,量化要保效果又降开销,延迟、功耗、发热全是硬骨头。
但这么做有个很实际的好处:省钱。
一部分计算搬到手机上,云端负载就下来了,运营成本随之降低。对一个面向普通消费者的应用来说,这一点决定了它能不能大规模铺开。
还有个细节值得注意:这整条链路从头到尾跑在国产硬件上。
训练用昇腾NPU,云端推理用昇腾平台,端侧跑麒麟芯片。
这条路线让MoWorld的推理成本只有同等进口GPU方案的30%。降本70%,这才是世界模型能规模化落地的真前提。

不止是看着真:它开始懂物理了
跑得动、跑得起之外,MoWorld还在持续拉高技术上限。
如果它只是能生成逼真的3D场景,那不过是个高级建模工具。真正让它配得上「世界模型」四个字的,是它开始理解物理规律。
今年7月MoWorld 1.0发布时,主打一个「快」——全国产NPU,最高约50 FPS实时交互。那时候它已经证明自己不是论文demo,而是真能跑起来的系统。
之后的迭代速度很猛。到9月底,几个关键能力已经质变:
物理属性进来了。重力、弹力、刚性、外力,这些真实世界的规则被显式融入模型。
踢一脚足球,球沿地面滚动弹起;碰一下花草,花草会摆动;同一场景可以切换晴天雨天雪天。
模型不再只管「世界看起来什么样」,开始回答「世界被碰了一下会怎么变」。
渲染帧率提高了。3D/4D高斯资产渲染突破500 FPS,手机端侧也能跑到100 FPS。不需要高端显卡,普通手机就能流畅呈现三维交互世界。
输出的东西能用了。MoWorld生成的不再只是「好看的3D视频」,而是标准化的3D/4D高斯资产,可以直接导入游戏引擎、影视制作系统、数字孪生平台、机器人训练环境。生成一次,到处调用。
场景还能改。增删物体、调整位置、切换天气,同一条街可以一键从晴天变暴雪,同一个影视场景换道具换镜头,不用从头重建。
把这些能力叠在一起看,MoWorld更接近于在模拟一个遵循物理规律的平行世界。
而摸小宠恰恰是这个看着最「轻」的场景,证明了一件最「重」的事——4D世界模型可以跑在每个人的手机上。
过去,世界模型一直漂在实验室和论文里,从Sora到Atlas,大家讨论的都是能力多强、效果多好,但很少有人认真回答一个问题:普通人什么时候能用上?
魔芯科技用摸小宠回答,现在就可以。

全球坐标系下的MoWorld:
应用落地上的领先身位
把MoWorld放到全球竞争格局里看,它的差异化就更清晰了。
2026年9月,李飞飞创立的World Labs发布了Atlas——一个多模态世界模型,核心能力是使用少量照片生成可交互的3D世界。

这个产品在业内引发了巨大关注,某种程度上甚至标志着世界模型赛道正式进入国际主流视野。
Atlas和MoWorld有不少共同点:都可以用少量普通照片作为输入,都能输出三维场景结构,都支持自由浏览和新视角合成,都利用大模型来补全有限观测之外的空间信息。
但差异同样显著:
动态4D理解。 Atlas目前主要聚焦于静态3D空间的生成与理解。MoWorld则已经做到了动态4D——不仅理解空间,还理解时间。
物理交互能力。 MoWorld已经将重力、弹力、刚性等物理属性引入生成空间,物体能够对用户动作做出基于物理逻辑的响应。而Atlas目前更侧重于空间结构和多模态理解。
推理效率与成本。 MoWorld在推理速度和成本控制上具有优势。基于国产昇腾NPU的部署路线让它的推理成本只有进口GPU方案的30%,并且已经探索出了手机端侧运行的能力。
可以说,如果Atlas代表了世界模型在「空间理解深度」上的国际标杆,那么MoWorld的核心优势不仅在模型能力上不遑多让,更在应用落地上全面领先——
从4D动态理解到物理交互,从云端到端侧,从实验室到真实产品和产业流程,它已经跑出了一条完整的路。

00后博士和他的百亿征途
最后,聊聊这家公司。
魔芯科技的创始人陈天润是一个00后。浙江大学博士在读,师从中国工程院院士潘云鹤。
陈天润在Science、Nature Photonics、IEEE TPAMI等顶级期刊,以及ICCV、CVPR、ICML、SIGGRAPH等顶级会议上发表高水平论文50余篇。2022年获得共青团中央科技创新最高奖项「中国青少年科技创新奖」,是浙江省高校唯一获奖者。
他在央视的采访中说过一段话:「世界模型更像是给机器提供一个理解世界的大脑,让机器去理解它所在的环境,就像人一样,给机器提供了预测下一个世界状态的能力。这是一种冒险,但是冒险背后是我们真切地拿着这把舵在开这艘船,所以我相信既然这个舵掌握在我们手上,希望能够把这艘船开得很远。」

这不是一句空话。
从2025年底到2026年9月,魔芯科技在9个月内连续完成5轮融资,最新一轮融资规模达10亿元量级,公司估值已经逼近100亿元。投资界的评价是,这是世界模型赛道上跑得最快的中国选手之一。
如今,华为手机发布会上给了他们展示位。
从全国产算力训练到鸿蒙应用端的完整链路,魔芯科技已经成为4D世界模型领域的基础设施构建者。

