【百灵开源 Ling-3.0-flash-VL,用视觉反馈持续修正 Agent 操作】 #百灵开源 Ling30flashVL#
百灵大模型开源了 Ling-3.0-flash-VL 的 BF16 和 FP8 版本。这款模型共有 124B 参数,单次推理激活 5.5B 参数,核心思路是让 Agent 看见自己的执行结果,再反复完成「观察、行动、验证、修正」。
比如在网页复刻任务中,它会读取截图、生成前端代码、查看浏览器里的实际渲染,再根据差异继续修改;跨工具任务中,也会按当前界面状态调整点击、输入和滚动步骤。实时视觉能力已经接入灵光 App,用于物体、标识和场景识别。
官方没有回避限制:长尾感知、长链路 Agent、长程全栈编码、异常恢复和稳定性仍与最佳模型有差距。FP4 和 INT4 版本将随后发布,现有权重已在 Hugging Face 与 ModelScope 上线。
视觉 Agent 最该先解决的是网页复刻,还是跨应用操作的稳定性?

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”




