跳转到主要内容

阿里云0.8B小模型OvisOCR2登顶文档解析基准测试

7月24日,阿里巴巴在文档解析领域投下重磅炸弹,开源了OvisOCR2,一个仅有0.8B参数的模型。尽管体积小巧,它在OmniDocBench v1.6基准测试中取得了96.58的高分,夺得榜首。更重要的是,它是第一个全面超越传统流水线方法的端到端模型——这一范式转变让技术社区为之沸腾。

多年来,文档解析一直依赖于笨拙的两步流程:先分析布局,再识别内容。这就像用外语说明书组装宜家家具——维护成本高、容易出错、部署麻烦。OvisOCR2彻底推翻了这一模式。基于Qwen3.5-0.8B构建,它是一个单一模型,能够按照自然阅读顺序生成包含文本、公式、表格和视觉区域的Markdown表示。无需再同时使用多个工具,也无需处理级联错误。

那么,他们是如何做到的呢?团队结合了真实数据和合成数据,然后释放了四种技术:监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型集成。可以将其视为模型的训练营——SFT教授基础知识,RL优化策略,OPD让模型向更大的模型学习,而集成则确保模型不会陷入困境。结果呢?一个紧凑的强者,其表现远超自身规模。

Image

这不仅是阿里巴巴的胜利,也是所有构建RAG系统、智能问答平台或企业知识库的人的胜利。文档解析是这些技术的支柱,而OvisOCR2使其更快、更便宜、更准确。开源发布意味着开发者现在可以集成最先进的解析功能,而无需花费巨资或应对复杂的流水线。

展望未来,这可能是一个新时代的开始。如果小模型能够超越传统方法,为什么还要坚持旧方式呢?OvisOCR2证明,更大并不总是更好——有时,关键在于更聪明地工作,而不是更努力。

关键点

  • 模型:OvisOCR2,一个0.8B参数的端到端文档解析模型。
  • 基准测试:在OmniDocBench v1.6上得分96.58,排名第一。
  • 突破:第一个超越传统流水线方法的端到端模型。
  • 技术:结合了SFT、RL、OPD和模型集成。
  • 影响:简化了RAG、问答和知识库的文档解析。