阿里云0.8B小模型OvisOCR2登顶文档解析基准测试
阿里云刚刚在文档解析领域投下了一枚重磅炸弹。7月24日,该公司开源了OvisOCR2,一个仅有0.8B参数的模型。尽管体积小巧,它在OmniDocBench v1.6基准测试中取得了令人印象深刻的96.58分,夺得榜首。更重要的是,它是首个全面超越传统流水线方法的端到端模型。

多年来,文档解析一直依赖于笨拙的两步过程:先分析布局,再识别内容。这种方法就像用不同的团队分别建造房屋的框架和布线——虽然可行,但成本高、易出错且维护麻烦。OvisOCR2彻底摒弃了这种方式。基于Qwen3.5-0.8B,它一次性生成完整的Markdown表示,按自然阅读顺序保留文本、公式、表格和图像。
他们是如何将如此强大的功能塞进这么小的模型中的?该团队结合了真实数据和合成数据,然后应用了一系列技术:监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型集成。每种方法都进一步提升了性能,充分释放了紧凑架构的潜力。
这不仅仅是阿里巴巴的胜利,更是对整个行业的警醒。传统流水线复杂,每一步都可能引入累积的错误。OvisOCR2的单模型方法简化了部署,减少了维护麻烦。对于RAG检索、智能问答和企业知识库来说,这可能是一个颠覆性的改变。
关键点:
- OvisOCR2是一个0.8B参数的端到端文档解析模型。
- 它在OmniDocBench v1.6上获得96.58分,排名第一。
- 它通过单个模型超越了传统流水线方法。
- 采用的技术包括SFT、RL、OPD和模型集成。
- 该模型已开源,可供使用。