【百灵开源 Ling-3.0-flash-VL,用视觉反馈持续修正

【百灵开源 Ling-3.0-flash-VL,用视觉反馈持续修正 Agent 操作】 #百灵开源 Ling30flashVL#

百灵大模型开源了 Ling-3.0-flash-VL 的 BF16 和 FP8 版本。这款模型共有 124B 参数,单次推理激活 5.5B 参数,核心思路是让 Agent 看见自己的执行结果,再反复完成「观察、行动、验证、修正」。

比如在网页复刻任务中,它会读取截图、生成前端代码、查看浏览器里的实际渲染,再根据差异继续修改;跨工具任务中,也会按当前界面状态调整点击、输入和滚动步骤。实时视觉能力已经接入灵光 App,用于物体、标识和场景识别。

官方没有回避限制:长尾感知、长链路 Agent、长程全栈编码、异常恢复和稳定性仍与最佳模型有差距。FP4 和 INT4 版本将随后发布,现有权重已在 Hugging Face 与 ModelScope 上线。

视觉 Agent 最该先解决的是网页复刻,还是跨应用操作的稳定性?

【百灵开源 Ling-3.0-flash-VL,用视觉反馈持续修正