阿里云开源OvisOCR2:端到端文档解析模型首度登顶榜单

2026-07-24 17:35:55   |   嫣然   |   3845

7月24日,阿里云宣布开源文档解析模型OvisOCR2,以综合得分96.58的成绩刷新OmniDocBench v1.6榜单纪录,成为首个端到端模型超越传统流水线方法的登顶案例。官方将这一突破描述为"文档解析领域技术路线的重要转折"。

作为大模型落地的关键基础设施,文档解析承担着将PDF、扫描件等非结构化文档转化为结构化文本的任务。此前行业普遍采用"流水线方法"——由版面分析模型和内容识别模型分别识别文档布局、文字、公式和表格,最后拼接输出。这种方法虽然成熟,但维护成本高、误差会逐级累积、部署也较为复杂。

OvisOCR2选择了一条不同路径。它采用端到端技术路线,输入一张文档图像后,模型在一次生成中直接输出符合自然阅读顺序的Markdown表示,覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作,现在由一个模型一步到位。

与多数文档解析模型动辄数十亿的参数量形成对比的是,OvisOCR2仅由Qwen3.5-0.8B后训练得到,是一款参数量仅8亿的紧凑型模型。团队通过构建真实文档与合成文档互补的数据引擎体系,结合监督微调、强化学习、在线策略蒸馏和模型融合四阶段训练流程,充分释放了小模型的潜力。

在OmniDocBench v1.6榜单上,OvisOCR2以96.58分超越此前所有流水线方法,证明了"单模型一次生成"这一技术路线不仅理论上更简洁,在实际表现上同样具备可行性。项目已以Apache 2.0许可证开源,兼容vLLM等主流推理框架,开发者可无缝集成至现有工作流。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

阿里云开源OvisOCR2:端到端文档解析模型首度登顶榜单

2026-07-24 17:35:55 浏览量: 3845 作者: 嫣然

7月24日,阿里云宣布开源文档解析模型OvisOCR2,以综合得分96.58的成绩刷新OmniDocBench v1.6榜单纪录,成为首个端到端模型超越传统流水线方法的登顶案例。官方将这一突破描述为"文档解析领域技术路线的重要转折"。

作为大模型落地的关键基础设施,文档解析承担着将PDF、扫描件等非结构化文档转化为结构化文本的任务。此前行业普遍采用"流水线方法"——由版面分析模型和内容识别模型分别识别文档布局、文字、公式和表格,最后拼接输出。这种方法虽然成熟,但维护成本高、误差会逐级累积、部署也较为复杂。

OvisOCR2选择了一条不同路径。它采用端到端技术路线,输入一张文档图像后,模型在一次生成中直接输出符合自然阅读顺序的Markdown表示,覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作,现在由一个模型一步到位。

与多数文档解析模型动辄数十亿的参数量形成对比的是,OvisOCR2仅由Qwen3.5-0.8B后训练得到,是一款参数量仅8亿的紧凑型模型。团队通过构建真实文档与合成文档互补的数据引擎体系,结合监督微调、强化学习、在线策略蒸馏和模型融合四阶段训练流程,充分释放了小模型的潜力。

在OmniDocBench v1.6榜单上,OvisOCR2以96.58分超越此前所有流水线方法,证明了"单模型一次生成"这一技术路线不仅理论上更简洁,在实际表现上同样具备可行性。项目已以Apache 2.0许可证开源,兼容vLLM等主流推理框架,开发者可无缝集成至现有工作流。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号