技术路线新突破:阿里云开源发布0.8B文档解析模型OvisOCR2
科技
科技 > 人工智能 > 正文

技术路线新突破:阿里云开源发布0.8B文档解析模型OvisOCR2

凤凰网科技讯 7月24日,阿里云正式开源发布文档解析模型OvisOCR2。该模型以综合得分96.58刷新OmniDocBench v1.6榜单纪录,成为首个超越传统流水线方法并登顶该榜单的端到端模型,标志着文档解析领域迎来重要技术路线突破。

此前文档解析领域由“流水线方法”主导,需依次调用版面分析、文字识别等多个模型,存在维护成本高、误差累积等问题。OvisOCR2采用端到端路线:输入文档图像后,模型一次性输出符合自然阅读顺序的Markdown格式结果,覆盖文本、公式、表格和视觉区域,一个模型完成过去多模型协作的工作。

该模型由Qwen3.5-0.8B后训练得到,仅0.8B参数量即实现SOTA性能。训练采用监督微调、强化学习、在线策略蒸馏和模型融合四阶段流程,并构建了真实与合成文档互补的数据引擎体系,以充分释放紧凑模型潜力。OvisOCR2已以Apache 2.0许可证开源,兼容vLLM等主流推理框架,可与Qwen3.5生态无缝衔接。

亲爱的凤凰网用户:

您当前使用的浏览器版本过低,导致网站不能正常访问,建议升级浏览器

第三方浏览器推荐:

谷歌(Chrome)浏览器 下载

360安全浏览器 下载