本报告整理自项目离线评测(2026-05 至 2026-08),覆盖三代检索方案的对比: LightRAG 原生检索 → legacy DirectRetriever(四路召回,服务于 LightRAG 索引) → SelfDirectRetrieverV2(自研入库 + 自研检索,当前生产方案)。 原始评测脚本与结果文件不随仓库分发,本文只保留可复现的结论性数据。
| 评测集 | 规模 | 指标 | 说明 |
|---|---|---|---|
| 核电子学期刊论文库 | 17 题 | F1 / Recall@K(规则匹配)、Ragas CP/CR | 垂直领域主评测集 |
| HotpotQA | 30 题(多跳百科) | F1 / Recall@10 | 跨文档多跳推理 |
| GraphRAG-Bench(官方) | medical/novel 各 30 题 | 官方 context_relevancy / evidence_recall(LLM 判分) | 唯一对外口径 |
| 水文地质期刊库(自研) | 53/56/39 题三档(easy/hard/多证据跨文档) | Ragas 五指标 + 综合分 + Any/Coverage/All Hit | 自研 V2 主评测集,数据规模 78 |
| 用户真实问句集 | 20 题 | Ragas 五指标 | 面向实际课程场景 |
综合分 = Context Precision、Context Recall、Answer Relevancy、Faithfulness、Answer Correctness 五项等权平均(项目派生指标);多证据题另报 Any Hit(命中任一目标分块)、Coverage(目标分块平均覆盖率)、All Hit(全部目标证据命中)。
规则匹配:
| 方案 | F1 | Recall@10 | 检索延迟 |
|---|---|---|---|
| Direct 四路 + MMR_ONLY | 0.6292 | 0.6216 | 4.2s |
| LightRAG naive | 0.5536 | 0.5902 | 0.12s |
| LightRAG mix | 0.5128 | 0.6324 | 14.0s |
| LightRAG local / hybrid / global | 0.32–0.48 | 0.39–0.54 | 12–14s |
Ragas:
| 方案 | CP | CR |
|---|---|---|
| Direct 四路 + MMR_ONLY | 0.4524 | 0.5417 |
| LightRAG naive | 0.3382 | 0.3333 |
| LightRAG mix | 0.3157 | 0.6863 |
| LightRAG global | 0.1078 | 0.1176 |
结论:Direct 四路在 F1 与 CP 上全面领先 LightRAG 全部原生 mode;mix 唯一 CR 更高(+0.145)但 CP 低 0.137,广召回伴随噪声;naive 是 LightRAG 内部最快最均衡,但质量仍低于 Direct。
| 方案 | F1 | Recall | Recall@10 | 延迟 |
|---|---|---|---|---|
| Direct MMR_ONLY | 0.2376 | 0.7022 | 0.7078 | 6.00s |
| LightRAG 原生 | 0.1334 | 0.4078 | 0.3967 | 7.85s |
结论:图扩展 BFS 修复后,Direct 在标准多跳集上 F1 +78%、Recall +72%,延迟反而更低。
| 知识库 | 生产 Profile | LightRAG 最佳 mode | 结论 |
|---|---|---|---|
| medical | CR 0.825 / ER 0.733 | local 0.733 / naive 同档 | 生产四路 验证通过;hybrid(0.433)/global 显著偏弱 |
| novel | CR 0.700 / ER 0.600 | naive 0.744 / mix 0.633 | 生产 RAW 合理;小说库上 LightRAG naive 更高(向量优先更适合该域,诚实记录) |
关键词提取专项:hybrid 提词(medical ER 0.70)显著优于 LightRAG LLM 提词(0.50);两路提词 Jaccard≈0.008,几乎无重叠;自研词注入 LightRAG 反而劣化(0.43→0.15),已禁止。
自研方案四路并行:Path-A 实体向量 + Path-B Redis BM25(HanLP 词法) + Path-C chunk 向量(Milvus) + Path-D Nebula 图扩展;图片/表格/公式意图条件触发 Path-E 媒体召回。
| 消融 | 结论 |
|---|---|
| 关闭 Path-C(chunk 向量) | CP 接近归零——压舱石,不可关闭 |
| 关闭 Path-D(图扩展) | F1 下降约 22%——修复无向 BFS 传导后对多跳召回关键 |
| 关闭 PPR(Stage-2) | 最大正收益:PPR 相对 MMR_ONLY 使 CP −44%、CR −17% |
| Stage-2 生产选择 | MMR_ONLY(垂直库)而非 RAW:去重收益,MMR 关闭后 CP 明显下降 |
| 方案 | 综合分 | CP | CR | 延迟 |
|---|---|---|---|---|
| 单向量(bm25 种子直检) | 0.7806 | 0.7288 | 0.8542 | 0.371s |
| 优化版(多路+证据准入),无父扩展 | 0.7522 | 0.6606 | 0.8583 | 0.943s |
| 优化版 + 父文档扩展 | 0.7422 | 0.6399 | 0.8539 | 1.311s |
| PathRAG,无父扩展 | 0.7625 | 0.6738 | 0.8731 | 2.910s |
| PathRAG + 父扩展 | 0.7552 | 0.6906 | 0.8596 | 3.182s |
结论:在多证据困难题上,轻量单向量直检是当前最优与最快基线;PathRAG 与父文档扩展未带来稳定综合收益(PathRAG 延迟为单向量的 7.8 倍)。瓶颈在论文内证据精排与整合,而非论文召回(窗口 All Hit 仅 15%→20%,Doc Hit 已达 97.5%)。
| 必要种子 | 综合分 | 检索分 | 延迟 |
|---|---|---|---|
| 仅实体向量(改前基线) | 0.7425 | 0.7875 | 1.853s |
| 仅 HanLP/BM25 词法 | 0.7532 | 0.8220 | 0.983s |
| 向量 0.7 + BM25 0.3 | 0.7412 | 0.7936 | 0.981s |
结论:纯 HanLP/BM25 必要种子质量与速度双优——自研入库建立的词法索引(BM25 postings)直接反哺检索种子,这正是自研链路一体化的收益。
| 方案 | 综合分 | Any Hit | 直接 All Hit | 延迟 |
|---|---|---|---|---|
| 查询分解 + 生产边界裁判 | 0.6909 | 94.9% | 5.1% | 2.41s |
| + PPR 证据发现(深度检索组合) | 0.7073 | 100% | 12.8% | 8.75s |
96 题五臂实验的超可加效应:边界裁判单独 +0.004、PPR 证据单独 +0.0085、组合 +0.0230。深度检索(deep_retrieval=true)作为按请求的质量/延迟权衡开关保留。
- Time-Aware MMR 不适用于无可靠日期的学术库:历史期刊缺日期时 decay 算子默认 β=0 惩罚降权,CR 降至 0.1083(RAW 直通 0.3407 最佳)。
- 多库融合:加权(weighted)远超 RRF:RRF 易单库垄断前排(KB 覆盖跌至 50%);NE 加权 1.5:1.0 实体覆盖 62.05%,为多库联合检索生产推荐。
生产优化方案在用户真实问句集上复测通过;异常题重测与结构化 v4 提升详见原始报告(不随仓库分发)。
| # | 结论 | 落地 |
|---|---|---|
| 1 | 自研直检(SelfDirectRetrieverV2)质量与延迟全面优于 LightRAG 原生检索(期刊库/HotpotQA/GraphRAG-medical) | omnigraph 唯一检索路径 |
| 2 | 垂直库 Stage-2 用 MMR_ONLY,禁用 PPR | domain / lightweight Profile |
| 3 | Path-C(chunk 向量)为底座不可关闭;Path-D 图扩展对多跳关键 | 四路默认全开 |
| 4 | 困难多证据题上轻量单向量直检优于 PathRAG/父扩展(0.7806 vs 0.7625,延迟 1/7.8) | 默认 bm25 种子直检 |
| 5 | 必要种子纯 HanLP/BM25 最优(自研入库索引反哺检索) | seed_weight_mode=bm25 |
| 6 | 深度检索(边界裁判+PPR 证据)超可当提升,按需开启 | deep_retrieval 请求参数 |
| 7 | Time-Aware 不用于学术库;多库融合用加权而非 RRF | Profile / 融合策略 |
| 8 | novel 类库 LightRAG naive 更高(0.744 vs 0.600)——诚实记录的例外场景 | 已随 LightRAG 移除而放弃该场景 |
上述评测支撑了 2026-08 的架构决策:自研入库 + 自研检索在主垂直场景 (期刊库、多跳、GraphRAG-medical、困难多证据题)全面达到或超过 LightRAG 原生能力,且延迟更低、索引可控(BM25 种子反哺、七阶段提交、可见性 fencing); LightRAG 的增量价值(novel 库 naive 场景)不足以抵偿双轨维护成本, 故 omnigraph 仅保留自研链路。