返回列表 发布新帖
查看: 6|回复: 0

[人工智能] 阿里开源0.8B文档解析模型,端到端模型首次超越流水线方法

发表于 昨天 15:37 | 查看全部 |阅读模式

这里或许是互联网从业者的最后一片净土,随客社区期待您的加入!

您需要 登录 才可以下载或查看,没有账号?立即注册

×
7月24日消息,今日,阿里云开源发布文档解析模型OvisOCR2。

该模型以96.58的综合得分刷新OmniDocBench v1.6榜单纪录,成为首个超越流水线方法并登顶该榜单的端到端模型,这是文档解析领域迎来技术路线的重要突破。

B8C4D5F1-335B-48bf-8603-04F6DEEE6AEF.png

据介绍,OvisOCR2采用端到端技术路线:输入一张文档图像,模型在一次生成中输出符合自然阅读顺序的Markdown表示,覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作,现在由一个模型一步到位。

在OmniDocBench v1.6上以96.58分登顶,首次证明端到端模型可超越流水线方法。

OvisOCR2由Qwen3.5-0.8B后训练得到。团队构建了真实文档与合成文档互补的数据引擎体系,合成文档专门补充表格与公式交织、多栏版式、长输出等复杂场景。训练方案融合监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合四阶段流程,形成多阶段递进式的训练流程,充分释放紧凑模型的潜力。

144561E1-192D-46fa-BF1D-6182A8093388.png

OvisOCR2以Apache 2.0许可证开源,兼容vLLM等主流推理框架,与Qwen3.5推理生态衔接,开发者无需额外适配即可集成。

模型获取方式:

Hugging Face: https://huggingface.co/ATH-MaaS/OvisOCR2

魔搭:https://modelscope.cn/models/ATH-MaaS/OvisOCR2

技术报告:https://arxiv.org/abs/2607.13639
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Copyright © 2001-2026 Suike Tech All Rights Reserved. 随客交流社区 (备案号:津ICP备19010126号) |Processed in 0.125316 second(s), 7 queries , Gzip On, MemCached On.
关灯 在本版发帖返回顶部
快速回复 返回顶部 返回列表