一、知识库与RAGFlow介绍
金融机构需要实时关注金融市场动向,面临大量文本和结构化数据信息。大模型可辅助处理这些信息,而RAG(检索知识增强)架构方案成为重要探索方向。RAGFlow开源架构因其高质量解析检索特性备受关注,其核心优势包括:
- 解析方面:通过DeepDoc实现高质量知识解析,对不同文档进行分类处理。
- 检索方面:采用“关键词+向量”双路搜索,并结合Raptor召回增强、知识图谱等策略提升检索质量。
- 兼容方面:支持结构化数据解析,如使用Table模型解析财务报表,实现多模态知识兼容。
- 使用方面:提供Agent搭建框架,基于高质量知识库实现自定义工作流。
二、RAGFlow部署要求与方法
RAGFlow基于Linux环境上的Docker容器运行,对软硬件配置要求较高。基础要求包括:
- 硬件:CPU >= 4核,内存 >= 16GB,磁盘 >= 50GB。
- 软件:Docker版本 >= 24.0.0,Docker Compose版本 >= v2.26.1,vm.max_map_count参数 = 262144。
推荐使用内存 >= 32GB的机器部署,并开启虚拟内存缓解硬件配置不足问题。部署过程包括克隆仓库、启动服务器、确认状态等步骤。
三、RAGFlow入库与检索流程
RAGFlow使用流程分为系统设置、文档入库、检索配置和检索回答四个阶段。
- 系统设置:配置AI大模型、向量化模型和重排序模型。
- 文档入库:完成文档解析入库相关参数和策略配置,可选择设置元数据提高检索质量。
- 检索配置:配置聊天助理、提示引擎和模型,影响信息检索质量。
- 检索回答:选择聊天助手创建对话,输入问题获取回答,并显示知识来源。
报告还提供了推荐参数配置方案,并在实际使用中根据情况进行调整。
四、RAGFlow的自动化应用
RAGFlow提供Python API进行批量操作,完成文档传入、解析、创建聊天助手、开始聊天、获取回答等基础操作。但当前版本API存在缺陷,如无法开启Deep Research检索等。
五、RAGFlow项目运用实战
报告以智能投研系统为例,展示了RAGFlow的应用实践:
- Text to SQL工作流:通过知识库支持,提高SQL语言准确率,满足自然语言提取数据需求。
- 数据类信息获取工作流:构建数据类信息获取工作流,综合处理结构化数据问题,包括基础任务和进阶任务。
- 多信息源融合Agent:融合数据信息、文本信息和互联网信息,构建多维度金融信息获取Agent,实现复杂问题解答。
六、总结
RAGFlow通过引入本地知识库为大模型提供准确、及时的额外信息,缓解大模型信息滞后、存在“幻觉”等问题。报告详细介绍了RAGFlow的部署、使用、实际问题解决等角度,并展示了其在智能投研系统中的应用实践,为金融机构利用大模型辅助分析提供了参考方案。
风险提示
- RAGFlow版本更新可能带来功能变化。
- 知识库效果受模型选择影响。
- 大语言模型使用受限制,输出结果具有一定波动性。
- 推荐参数和模型选择需根据实际情况调整。