v0.18.0 版本中第二点更新主要是修复了在pdf 文档解析中无法使用外部VL模型进行布局和图片内容解析的问题。https://github.com/infiniflow/ragflow/pull/6278  主要是修复了在RagFlow 解析PDF文档时,选择了VL 模型,比如Qwen/Qwen2.5-VL-32B-Instruct也不生效的问题。

我到0.17.2版本去试了一下,发现的确用不了外部的VL 模型。下面我们来对比一下两个版本的差别。

1.v0.17.2 版本

  首先配置一下VL 模型,可以访问硅基流动用户系统,统一登录 SSO,通过手机号可以注册,默认赠送10多块钱的token。

1.1 注册硅基流动的API-KEY

在硅基流动中找一下VL 模型

1.2 在RagFlow 中配置API-KEY 和模型信息

输入API-KEY

1.3 创建知识库-> 设置pdf 解析器为siliconflow 提供的模型

观察解析日志

从日志上看还是通过本地的OCR 模型进行解析

2.v0.18.0 版本

首先将pdf 解析器配置成siliconflow 的qwen VL 模型

这里嵌入模型使用的是通过xinference 部署的embeding和Rerank 模型,因为部署简单,使用的资源也少,2G 显存就OK ,推荐有显卡资源的自己部署一下,后续专门写一篇。

这里可以看到,已经通过请求silionflow.cn 来进行图片的识别,layout_recognize 已经是配置的qwen vl 模型了。正是https://github.com/infiniflow/ragflow/pull/6278 问题解决的内容,也是0.18.0版本第二点增强的内容。

最后成功解析出来结果,下面对比一下用VL 模型的解析结果和不用VL模型的区别

由于上面的PDF 超过了5M 导致silionflow.cn 报错了,(这里我还发现一个Bug.)我更换了PDF,当使用VL模型进行解析的时候。查看分块的结果

再比较一下用deepdoc 中默认模型解析的结果

可以看出VL 模型更侧重对整体图片的理解, Deepdoc 中的默认解析侧重OCR. 因此具体使用哪种模型因以知识材料性质来具体判断。下面看一下问答效果。

大模型选择QWQ 32B 输入问题:

“吾来是怎样通过输出智能对话技术和智能沟通工具,助力各行各业实现在线助理的智能化”

1.使用VL 模型进行解析的问答结果

 

2.使用OCR 解析的结果

个人觉得使用VL 模型还是能够获取到更多原材料中的知识细节信息。问答结果更细致一些。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐