位置:首页 > 热点资讯 > 阿里开源0.8B文档解析模型OvisOCR2端到端首次超越流水线方法

阿里开源0.8B文档解析模型OvisOCR2端到端首次超越流水线方法

时间:2026-07-28  |  作者:风起客  |  阅读:0

先平复一下心情,说个值得关注的消息——7月24日,阿里云低调开源了文档解析模型OvisOCR2。

这个模型以96.58的综合得分重新刷新了OmniDocBench v1.6榜单。更重要的是,它成为首个端到端模型超越流水线方法并登顶该榜单的选手。官方称之为“技术路线的重要突破”。从行业角度看,这确实不是一个虚词。

阿里开源 0.8B 文档解析模型 OvisOCR2,端到端模型首次超越流水线方法

端到端模型首次超越流水线方法

文档解析是AI落地的基础设施

很多人可能不太清楚文档解析在AI落地中的位置。简单说,它是大模型落地的关键基础设施——企业知识库、RAG检索、智能问答等场景,都需要把PDF、扫描件等非结构化文档转化为结构化文本。这一步做不好,后面的一切都无从谈起。

流水线方法的痛点

过去这个领域的主导力量是“流水线方法”。拆分来看,它由版面分析模型和内容识别模型两部分组成:前者负责识别文档布局,后者负责文字、公式、表格等内容的识别,最后再拼接输出。这套方法成熟归成熟,但痛点也很明显——维护成本高、误差累积、部署复杂,属于典型的“三个和尚抬水喝”模式。

OvisOCR2的端到端突破

OvisOCR2走的是端到端技术路线:输入一张文档图像,模型在一次生成中直接输出符合自然阅读顺序的Markdown表示,覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作,现在一个模型一步到位。在OmniDocBench v1.6上以96.58分登顶,这是第一次端到端模型用硬实力证明自己可以超越流水线方法。

小参数大能力,0.8B实现SOTA

让人意外的是,OvisOCR2的基座是Qwen3.5-0.8B——一个不到1B参数的紧凑模型。小参数能有多大能量?背后是团队构建的数据引擎体系:真实文档与合成文档互补,合成文档专门补充表格与公式交织、多栏版式、长输出等复杂场景。

训练方案融合了监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合四阶段流程,形成多阶段递进式训练,把紧凑模型的潜力释放到了极致。

▲ OvisOCR2 数据引擎体系

项目已开源发布,无缝融入千问生态

OvisOCR2以Apache 2.0许可证开源,兼容vLLM等主流推理框架,与Qwen3.5推理生态衔接。对于开发者来说,这意味着无需额外适配即可直接集成,省去了很多常规开源项目的“适配成本”。

模型获取方式:

  • Hugging Face
  • 魔搭
  • 技术报告

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多