前言

最近看论文看到一篇多模态大模型相关的,《MonkeyOCR: Document Parsing with a
Structure-Recognition-Relation Triplet Paradigm》是一种基于构造-识别-关系三元组范式的文档分析模型。

基本结构

在这里插入图片描述
系统采用结构识别关系框架,包括结构检测,定位和分类语义区域;块级内容识别,并行提取每个区域的结构化信息;和关系预测,确定检测到的元素的逻辑阅读顺序。

实验效果

无论是得分还是推理速度还是杠杠的,优于不少当前的模型,并且模型可以在3090上推理。
在这里插入图片描述
在这里插入图片描述

个人实验的效果

一个双栏13页的论文,一分钟OCR就将所有东西识别保存下来。
在这里插入图片描述

图片以及识别的内容均保存下来,并且公式可以以latex公式的出来

在这里插入图片描述

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐