智能检索选择:GraphRAG与向量RAG对比

在过去两年中,如果您构建过任何基于检索增强生成(RAG)的系统,您可能已经体验到了其核心痛点:您将文档分割成片段,进行嵌入处理,检索与问题最相似的几个片段,然后将其交给模型。对于”我们第三季度的退款政策是什么?”这类问题,这种方法效果很好。但对于”两年来的客户投诉中存在哪些重复主题?”这类问题,它就完全失效了——因为没有单个片段包含答案。
当前的流行解决方案是GraphRAG:与其向模型提供孤立的文本片段,您首先构建语料库中实体和关系的知识图谱,然后利用该结构作为上下文。这个方案听起来很有吸引力。但吸引人的方案值得仔细审视,因此我研究了证据——包括原始的微软论文以及四项独立的基准研究,以回答一个简单问题:当您用上下文图谱替换文本片段时,答案真的会变得更好吗?
简短的答案是:是的,效果显著提升——但仅适用于特定类型的问题,而且并非没有成本。让我为您展示证据。
为什么文本片段会遭遇瓶颈
标准的向量RAG会检索与查询最相似的k个文本片段。这种设计存在三个结构性盲点:
- 无法连接点与点。当答案需要通过共享实体连接不同片段中的事实时,孤立嵌入的片段永远无法揭示这种联系。
- 对全局性问题视而不见。“主要主题是什么?”需要整个语料库,但相似性搜索只返回与问题表面相似的少数几个片段。
- 在片段边界处切断上下文。复杂推理所依赖的关系和层级结构,恰好是分块处理时被抛弃的内容。
微软研究院在介绍GraphRAG时精辟地指出了这一点:基础RAG”难以连接点与点”,在要求”对大型数据集进行整体理解总结性语义概念”时表现不佳。
上下文图谱带来了什么变化
GraphRAG在问题提出之前就着手解决这一问题。在索引阶段,大型语言模型(LLM)阅读每个片段并提取实体、关系和主张,将它们组装成加权知识图谱。然后,它运行社区检测(Leiden算法)将图谱聚类成相关主题的层级结构,并为每个社区预写自然语言摘要。
在查询时,这些摘要承担了繁重的工作。每个相关社区草拟部分答案(“映射”步骤),然后对这些部分进行排序和合并(“归约”步骤),最后模型基于结构而非少数精心挑选的片段合成最终响应。类似HippoRAG的变体采用不同路径,使用图谱加上个性化PageRank遍历来寻找正确的片段——但核心思想相同:让关系而非余弦相似度决定模型看到的上下文。
证据:四项研究,一种模式
1. 全局性理解:最显著的胜利
微软将GraphRAG与基础RAG在全球性”理解整个语料库”的问题上进行了直接对比,使用百万代币数据集,并由LLM作为评判者,从三个维度进行评估:全面性、多样性和赋能性。
在全面性对比中,GraphRAG赢得了72%到83%;在多样性对比中,GraphRAG赢得了62%到82%,超越了向量RAG。其最高级别的摘要使用的代币数比直接处理源文本少高达97%。
这不仅仅是微小的改进。在恰恰是文本片段RAG无法应对的问题类型上,图谱方法有三分之二或更高的胜率。
2. 多跳检索:图谱找到片段错过的内容
第二项证据是关于检索质量的:正确的支持性片段是否真的进入了前几名结果?在标准的多跳问答基准测试(MuSiQue、HotpotQA、2WikiMultiHopQA)中,图谱引导的检索显著提高了Recall@5指标:
- 平均Recall@5从基础RAG的73.4%提升到图谱引导的87.8%,增长了19.6个百分点。
- 最大的提升出现在最难、跨文档的集合中:MuSiQue上增长31个百分点,2Wiki上增长28个百分点。
- HippoRAG报告在多跳问答上准确度提升高达20%,同时成本降低10-20倍,速度比迭代检索方法快6-13倍。
3. 受控直接对比:坦诚面对现实
这是故事开始变得微妙的地方。密歇根州立大学和Meta的一项2025年研究在统一协议下运行RAG与四种GraphRAG变体,发现没有单一赢家。这两种方法是互补的:
- 在单跳、事实查找(自然问题)方面,普通RAG略占优势(F1分数64.8对最佳图谱方法的63.0)。
- 在多跳推理(MultiHop-RAG)方面,图谱引导的检索领先(整体准确率70.3对67.0)。
启示:上下文图谱不是通用升级,而是一种专业化方案,当问题需要跨片段推理时才能获得回报。
4. 何时使用图谱:任务类型判断
最新的基准测试GraphRAG-Bench(ICLR 2026)旨在回答”在哪些场景中图谱结构能提供可衡量的收益?”。其按任务划分的准确率数据清晰地划定了边界:
- 简单事实检索:文本片段60.9对图谱60.1——基本持平。图谱结构是查询不需要的开销。
- 复杂推理:图谱53.4对片段42.9——图谱领先10个百分点。
- 上下文摘要:图谱64.4对片段51.3——图谱领先13个百分点。
评分卡
从上到下阅读,模式显而易见:图谱的优势随着问题推理深度的增加而增长,而文本片段在孤立事实上保持其优势。
限制因素:成本与LLM评判问题
有两个限制因素使其并非决定性胜利,忽视这些因素是团队最终感到失望的原因。
构建图谱成本高昂。让LLM从整个语料库中提取实体和关系并不便宜。一项分析显示,对于中等规模的语料库,索引构建成本约为使用GPT-4o的48美元,远高于普通向量索引。(微软自己的后续产品LazyGraphRAG将提取推迟到查询时间,并将成本降至约0.1%——这实际上是承认原始预算对许多部署来说不切实际。)
许多胜利是由另一个LLM评判的——而LLM评判者存在偏见。一项独立研究显示,当比较两个系统时,评判LLM往往会偏爱使用自身技术栈的系统,可能导致结果偏差。
关注微信号:智享开源,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!