阿里云开源OvisOCR2:端到端文档解析模型首度登顶榜单
7月24日,阿里云宣布开源文档解析模型OvisOCR2,以综合得分96.58的成绩刷新OmniDocBench v1.6榜单纪录,成为首个端到端模型超越传统流水线方法的登顶案例。官方将这一突破描述为"文档解析领域技术路线的重要转折"。
作为大模型落地的关键基础设施,文档解析承担着将PDF、扫描件等非结构化文档转化为结构化文本的任务。此前行业普遍采用"流水线方法"——由版面分析模型和内容识别模型分别识别文档布局、文字、公式和表格,最后拼接输出。这种方法虽然成熟,但维护成本高、误差会逐级累积、部署也较为复杂。
OvisOCR2选择了一条不同路径。它采用端到端技术路线,输入一张文档图像后,模型在一次生成中直接输出符合自然阅读顺序的Markdown表示,覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作,现在由一个模型一步到位。
与多数文档解析模型动辄数十亿的参数量形成对比的是,OvisOCR2仅由Qwen3.5-0.8B后训练得到,是一款参数量仅8亿的紧凑型模型。团队通过构建真实文档与合成文档互补的数据引擎体系,结合监督微调、强化学习、在线策略蒸馏和模型融合四阶段训练流程,充分释放了小模型的潜力。
在OmniDocBench v1.6榜单上,OvisOCR2以96.58分超越此前所有流水线方法,证明了"单模型一次生成"这一技术路线不仅理论上更简洁,在实际表现上同样具备可行性。项目已以Apache 2.0许可证开源,兼容vLLM等主流推理框架,开发者可无缝集成至现有工作流。