
鹭羽 发自 凹非寺
不ber?写代码的大模型,还能帮忙满屋找鸭子?
Meta最新释出的这段demo,还真有点意思。
以Coding能力见长的Muse Spark 1.2,突然长出了具身手脚:
读画面、拆任务、定路线、调工具,再根据每一步的新观察修正行动,直到完成任务。
在另一段演示中,Muse Spark 1.2还能指挥双臂机器人整理桌面,各种长链任务均不在话下。
发布半个月后,Meta终于摊牌了……
Muse Spark 1.2更强的二段技原来在多模态。
它可以同时完成视觉编码、机器人规划以及视听理解,并通过Agent工具将全部能力串在一起。
从Meta公开成绩来看,这颗「大脑」委实很顶:
高难视觉推理测试ZeroBench中,Muse Spark 1.2狂揽54.0%,与旗舰模型GPT-5.6 Sol也只差0.6个百分点。

负责多模态Agent评测的Zengyi Qin,更是直接点出团队下一站:
继续押注多模态智能体,让它从感知走向行动,从数字世界走进物理世界。
以及……模型即将开源。

Meta给具身搭了两层大脑
先划重点,演示中的Muse Spark 1.2,并不是看一眼画面就直接输出机械臂的电机指令。
按照官方blog披露的架构,整套机器人系统分为上下两层。
上层是一款Muse Spark专用变体,负责充当具身总指挥。
用户给出一个抽象目标后,它先理解当前场景,识别周围物体和分清容易混淆的目标,再将整件事拆成一连串可以执行的子任务。
每个子任务则交由下层的同系列VLA模型执行。

整套流程其实和Muse Spark 1.2写代码时,底层逻辑是相通的。
都是接收目标后,拆分任务再逐步执行,只不过运行操作从写程序变成了移动和抓取,反馈内容也换成了摄像头画面。
具体来说,Muse Spark 1.2会对视频进行深度理解和密集描述,持续提取其中的场景变化,并调用网页开发、实时搜索和空间定位等Agent工具,把音视频里看见的信息转成下一步可执行的任务。
而这也是Meta首次如此集中地展示Muse Spark的具身能力,足以说明模型的视觉感知、任务推理和高层规划已然成熟,可以将模型决策推入物理世界中。
除了指挥机器人,视觉编码也是Meta此次强调的重中之重。
它能够根据一张图片或者一段视频直接生成网页和游戏,效果be like:
模型会先识别参考素材里的布局、层级、字体和视觉风格,再将这些信息翻译成能够运行的代码。
期间也会实时查看页面的渲染结果和交互行为,对照原始素材的偏差,再继续修改,这里依然是同一套自我迭代SOP。
另外,模型在Design Arena的多项榜单上均排名靠前,尤其是“视频生成网站”上位列第一。

一个模型干完全部活
为了更好地判断多模态Agent在真实任务中的交付能力,Meta还同步预览了一套内部评测工具——WildArtifactBench。
首批公开的10项任务覆盖得相当杂:
识别鸟鸣、分析心脏超声、判断冠状动脉狭窄、生成猫的3D网格、设计厨房布局、创建强化学习驾驶训练器、编辑视频……

以鸟鸣任务为例,会一次性交给模型46段音频和一份鸟类声音描述,要求它识别每段声音对应的物种,最终提交一张格式正确的CSV表格。
其中要求模型不仅能听懂,还要管理文件、记录判断、按照指定格式输出,并接受程序逐项验证。
难度相当之高,市面现有模型的表现均距离满分相差甚远。

目前,Muse Spark也已在Meta内部被部署在媒体生成等多个领域应用。
比如和Muse Image混合食用,协同完成智能媒介生成,同时输出精细的图像描述,作为Muse Image和Muse Video的训练数据。
Muse Spark还可以把原始文本和图视频内容打包整理成特征信号,供后续业务继续调用。
外部开发者也可以通过Meta Model API和Muse Code使用到Muse Spark 1.2,后续还将正式开源。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”