Skip to content

Latest commit

 

History

History
140 lines (99 loc) · 7.75 KB

File metadata and controls

140 lines (99 loc) · 7.75 KB

知识库检索评测报告:消融实验与 LightRAG 对比

本报告整理自项目离线评测(2026-05 至 2026-08),覆盖三代检索方案的对比: LightRAG 原生检索legacy DirectRetriever(四路召回,服务于 LightRAG 索引)SelfDirectRetrieverV2(自研入库 + 自研检索,当前生产方案)。 原始评测脚本与结果文件不随仓库分发,本文只保留可复现的结论性数据。

0. 评测体系

评测集 规模 指标 说明
核电子学期刊论文库 17 题 F1 / Recall@K(规则匹配)、Ragas CP/CR 垂直领域主评测集
HotpotQA 30 题(多跳百科) F1 / Recall@10 跨文档多跳推理
GraphRAG-Bench(官方) medical/novel 各 30 题 官方 context_relevancy / evidence_recall(LLM 判分) 唯一对外口径
水文地质期刊库(自研) 53/56/39 题三档(easy/hard/多证据跨文档) Ragas 五指标 + 综合分 + Any/Coverage/All Hit 自研 V2 主评测集,数据规模 78645 篇文档、4.7万4.2万 chunks
用户真实问句集 20 题 Ragas 五指标 面向实际课程场景

综合分 = Context Precision、Context Recall、Answer Relevancy、Faithfulness、Answer Correctness 五项等权平均(项目派生指标);多证据题另报 Any Hit(命中任一目标分块)、Coverage(目标分块平均覆盖率)、All Hit(全部目标证据命中)。


1. LightRAG 原生 vs DirectRetriever(legacy 时代)

1.1 期刊论文库(17 题,Top-K=10)

规则匹配:

方案 F1 Recall@10 检索延迟
Direct 四路 + MMR_ONLY 0.6292 0.6216 4.2s
LightRAG naive 0.5536 0.5902 0.12s
LightRAG mix 0.5128 0.6324 14.0s
LightRAG local / hybrid / global 0.32–0.48 0.39–0.54 12–14s

Ragas:

方案 CP CR
Direct 四路 + MMR_ONLY 0.4524 0.5417
LightRAG naive 0.3382 0.3333
LightRAG mix 0.3157 0.6863
LightRAG global 0.1078 0.1176

结论:Direct 四路在 F1 与 CP 上全面领先 LightRAG 全部原生 mode;mix 唯一 CR 更高(+0.145)但 CP 低 0.137,广召回伴随噪声;naive 是 LightRAG 内部最快最均衡,但质量仍低于 Direct。

1.2 HotpotQA 多跳(30 题)

方案 F1 Recall Recall@10 延迟
Direct MMR_ONLY 0.2376 0.7022 0.7078 6.00s
LightRAG 原生 0.1334 0.4078 0.3967 7.85s

结论:图扩展 BFS 修复后,Direct 在标准多跳集上 F1 +78%、Recall +72%,延迟反而更低。

1.3 GraphRAG-Bench 官方指标(medical/novel 各 30 题,23 方案全消融)

知识库 生产 Profile LightRAG 最佳 mode 结论
medical CR 0.825 / ER 0.733 local 0.733 / naive 同档 生产四路 验证通过;hybrid(0.433)/global 显著偏弱
novel CR 0.700 / ER 0.600 naive 0.744 / mix 0.633 生产 RAW 合理;小说库上 LightRAG naive 更高(向量优先更适合该域,诚实记录)

关键词提取专项:hybrid 提词(medical ER 0.70)显著优于 LightRAG LLM 提词(0.50);两路提词 Jaccard≈0.008,几乎无重叠;自研词注入 LightRAG 反而劣化(0.43→0.15),已禁止。


2. 自研检索(SelfDirectRetrieverV2)消融

自研方案四路并行:Path-A 实体向量 + Path-B Redis BM25(HanLP 词法) + Path-C chunk 向量(Milvus) + Path-D Nebula 图扩展;图片/表格/公式意图条件触发 Path-E 媒体召回。

2.1 检索路径消融(水文地质 53 题,78 篇/4.7万 chunks)

消融 结论
关闭 Path-C(chunk 向量) CP 接近归零——压舱石,不可关闭
关闭 Path-D(图扩展) F1 下降约 22%——修复无向 BFS 传导后对多跳召回关键
关闭 PPR(Stage-2) 最大正收益:PPR 相对 MMR_ONLY 使 CP −44%、CR −17%
Stage-2 生产选择 MMR_ONLY(垂直库)而非 RAW:去重收益,MMR 关闭后 CP 明显下降

2.2 检索形态消融(水文地质 56 题困难集:50 困难文本 + 6 图片,645 篇/4.2万 chunks)

方案 综合分 CP CR 延迟
单向量(bm25 种子直检) 0.7806 0.7288 0.8542 0.371s
优化版(多路+证据准入),无父扩展 0.7522 0.6606 0.8583 0.943s
优化版 + 父文档扩展 0.7422 0.6399 0.8539 1.311s
PathRAG,无父扩展 0.7625 0.6738 0.8731 2.910s
PathRAG + 父扩展 0.7552 0.6906 0.8596 3.182s

结论:在多证据困难题上,轻量单向量直检是当前最优与最快基线;PathRAG 与父文档扩展未带来稳定综合收益(PathRAG 延迟为单向量的 7.8 倍)。瓶颈在论文内证据精排与整合,而非论文召回(窗口 All Hit 仅 15%→20%,Doc Hit 已达 97.5%)。

2.3 必要种子策略(53 题)

必要种子 综合分 检索分 延迟
仅实体向量(改前基线) 0.7425 0.7875 1.853s
仅 HanLP/BM25 词法 0.7532 0.8220 0.983s
向量 0.7 + BM25 0.3 0.7412 0.7936 0.981s

结论:纯 HanLP/BM25 必要种子质量与速度双优——自研入库建立的词法索引(BM25 postings)直接反哺检索种子,这正是自研链路一体化的收益。

2.4 深度检索(边界裁判 + PPR 证据发现,39 题跨文档多证据)

方案 综合分 Any Hit 直接 All Hit 延迟
查询分解 + 生产边界裁判 0.6909 94.9% 5.1% 2.41s
+ PPR 证据发现(深度检索组合) 0.7073 100% 12.8% 8.75s

96 题五臂实验的超可加效应:边界裁判单独 +0.004、PPR 证据单独 +0.0085、组合 +0.0230。深度检索(deep_retrieval=true)作为按请求的质量/延迟权衡开关保留。

2.5 时间感知与多库融合(N=18)

  • Time-Aware MMR 不适用于无可靠日期的学术库:历史期刊缺日期时 decay 算子默认 β=0 惩罚降权,CR 降至 0.1083(RAW 直通 0.3407 最佳)。
  • 多库融合:加权(weighted)远超 RRF:RRF 易单库垄断前排(KB 覆盖跌至 50%);NE 加权 1.5:1.0 实体覆盖 62.05%,为多库联合检索生产推荐。

2.6 用户真实问句验证(20 题)

生产优化方案在用户真实问句集上复测通过;异常题重测与结构化 v4 提升详见原始报告(不随仓库分发)。


3. 生产结论总表

# 结论 落地
1 自研直检(SelfDirectRetrieverV2)质量与延迟全面优于 LightRAG 原生检索(期刊库/HotpotQA/GraphRAG-medical) omnigraph 唯一检索路径
2 垂直库 Stage-2 用 MMR_ONLY,禁用 PPR domain / lightweight Profile
3 Path-C(chunk 向量)为底座不可关闭;Path-D 图扩展对多跳关键 四路默认全开
4 困难多证据题上轻量单向量直检优于 PathRAG/父扩展(0.7806 vs 0.7625,延迟 1/7.8) 默认 bm25 种子直检
5 必要种子纯 HanLP/BM25 最优(自研入库索引反哺检索) seed_weight_mode=bm25
6 深度检索(边界裁判+PPR 证据)超可当提升,按需开启 deep_retrieval 请求参数
7 Time-Aware 不用于学术库;多库融合用加权而非 RRF Profile / 融合策略
8 novel 类库 LightRAG naive 更高(0.744 vs 0.600)——诚实记录的例外场景 已随 LightRAG 移除而放弃该场景

4. 与 LightRAG 拆分的决策依据

上述评测支撑了 2026-08 的架构决策:自研入库 + 自研检索在主垂直场景 (期刊库、多跳、GraphRAG-medical、困难多证据题)全面达到或超过 LightRAG 原生能力,且延迟更低、索引可控(BM25 种子反哺、七阶段提交、可见性 fencing); LightRAG 的增量价值(novel 库 naive 场景)不足以抵偿双轨维护成本, 故 omnigraph 仅保留自研链路。