RagFlow-v0.18.0 新特性-2 文档布局识别过程中采用 VLM 模型作为处理流水线,从而实现对 PDF 中图像的深度分析
v0.18.0 版本中第二点更新主要是修复了在pdf 文档解析中无法使用外部VL模型进行布局和图片内容解析的问题。https://github.com/infiniflow/ragflow/pull/6278 主要是修复了在RagFlow 解析PDF文档时,选择了VL 模型,比如Qwen/Qwen2.5-VL-32B-Instruct也不生效的问题。
我到0.17.2版本去试了一下,发现的确用不了外部的VL 模型。下面我们来对比一下两个版本的差别。
1.v0.17.2 版本
首先配置一下VL 模型,可以访问硅基流动用户系统,统一登录 SSO,通过手机号可以注册,默认赠送10多块钱的token。
1.1 注册硅基流动的API-KEY


在硅基流动中找一下VL 模型

1.2 在RagFlow 中配置API-KEY 和模型信息
输入API-KEY

1.3 创建知识库-> 设置pdf 解析器为siliconflow 提供的模型

观察解析日志

从日志上看还是通过本地的OCR 模型进行解析
2.v0.18.0 版本
首先将pdf 解析器配置成siliconflow 的qwen VL 模型

这里嵌入模型使用的是通过xinference 部署的embeding和Rerank 模型,因为部署简单,使用的资源也少,2G 显存就OK ,推荐有显卡资源的自己部署一下,后续专门写一篇。

这里可以看到,已经通过请求silionflow.cn 来进行图片的识别,layout_recognize 已经是配置的qwen vl 模型了。正是https://github.com/infiniflow/ragflow/pull/6278 问题解决的内容,也是0.18.0版本第二点增强的内容。
最后成功解析出来结果,下面对比一下用VL 模型的解析结果和不用VL模型的区别
由于上面的PDF 超过了5M 导致silionflow.cn 报错了,(这里我还发现一个Bug.)我更换了PDF,当使用VL模型进行解析的时候。查看分块的结果


再比较一下用deepdoc 中默认模型解析的结果


可以看出VL 模型更侧重对整体图片的理解, Deepdoc 中的默认解析侧重OCR. 因此具体使用哪种模型因以知识材料性质来具体判断。下面看一下问答效果。
大模型选择QWQ 32B 输入问题:
“吾来是怎样通过输出智能对话技术和智能沟通工具,助力各行各业实现在线助理的智能化”
1.使用VL 模型进行解析的问答结果



2.使用OCR 解析的结果

个人觉得使用VL 模型还是能够获取到更多原材料中的知识细节信息。问答结果更细致一些。
更多推荐

所有评论(0)