NebulaGraphTeam的探索与实战
图Graph是什么
图是一种由节点(vertices)和边(edges)组成的数据结构,用于表示实体之间的关系,其中节点代表对象,边表示对象之间的连接或关联。图论的历史可以追溯到1736年,莱昂哈德·欧拉发表的《柯尼斯堡七桥问题》被认为是图论历史上的第一篇论文。
为什么需要Graph
图技术具有广泛的应用场景,包括:
- 知识图谱
- 推荐系统
- 社交网络
- DevSecOps
- 欺诈检测
- 供应链管理
- 大语言模型(LLM)
- 数字营销
GraphRAG
GraphRAG是一种结合图结构和检索增强生成(RAG)方法的技术,旨在解决传统RAG方法的局限性:
- RAG原理:通过检索相关文档并增强大模型的上下文学习,实现“开卷考试”式的问答。
- 传统RAG挑战:
- 分割数据时难以召回细粒度知识点,线性分割会丢失知识内在的全局上下文和关联。
- 通用嵌入模型无法理解领域知识,导致检索结果与实际需求不相关。
- GraphRAG优势:
- 通过图结构实现确定可复现的高质量关联,避免幻觉。
- 图库高效且成本低,能够淬炼领域知识推理并转化为I/O查询。
- 图索引凝练、细粒度且保留全局互联结构,便于“大海捞针”和“穿针引线”式检索。
GraphRAG案例
GraphRAG在多个场景中展现出显著效果:
- 降低幻觉:通过图探索和重新排序,减少向量搜索带来的幻觉问题。
- 精细知识检索:从知识点触发,通过子图探索获取全面知识序列。
- 全局上下文:通过多跳探索关联知识,解决复杂问题(如评估金融危机后各国监管变化对银行信贷政策的影响)。
- 结构化数据增强:结合SQL和图查询,提升检索效果。
- 面向业务建模:细化图状领域知识并应用于召回。
- 海马体RAG:结合脑神经启发策略和图算法。
- MSPaper:FromLocaltoGlobal:利用LLM抽取开放式同构图谱,并通过社区识别算法进行知识聚类。
Graph RAG的分类
GraphRAG可根据不同维度进行分类:
- 按图特性:分析性质、知识
- 按召回方式:Text2GQL、SubGraphRAG、PlanningBased(ChainofExploration)
- 按领域:单一领域、通用领域
- 按编排/索引方式:RerankwithVector、Route、GraphIndex
- 按建模方式:面向文档、面向领域、面向关系标签
GraphRAG很贵?
GraphRAG的成本效益分析:
- 图索引将上下文学习前置到索引期,查询期通过数据库查询实现推理,成本较低。
- 索引成本约为语料token消耗的20倍,但可通过BATCHAPI/Fine-tune降低。
- 索引范围可选,推荐对重要语料进行图索引或按需增量索引。
GraphRAGROI
GraphRAG的投资回报分析:
- 收益:
- 满足细粒度、全局上下文搜索需求。
- 优化RAG效果,引入分层结构索引(如Tree-RAG)。
- 提升知识组织形式的专业化(如LinkedIn的GraphModeling)。
- 投入:
- 原始数据做高级索引,降低推理成本。
- 索引范围可选,BATCH和Fine-tune可进一步降低成本。
- 引入Graph存储,利用现有图技术团队的技术积累。
我们的工作
悦数科技提供了一系列图增强大模型解决方案:
- GenAISuite图增强大模型SDK:包含Text2Query插件、GraphRAG、ChainofExploration、GraphMemory等功能。
- Catalyst知识智能应用平台:开箱即用GraphRAG。
- 悦数图数据库:支持大规模图数据管理。
NebulaGraph
NebulaGraph是全球领先的图数据库产品:
- 技术优势:
- 分布式和云原生设计,支持海量节点和边。
- 开源项目,拥有活跃社区和生态系统。
- 市场地位:
- 中国第一,世界第三的图数据库产品。
- 获得多项荣誉和认证,兼容主流信创芯片和操作系统。
- 用户案例: