You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
flowchart TB
A[Graph Extraction Output] --> B[Syntax Validity]
A --> C[Schema Validity]
A --> D[Entity Quality]
A --> E[Relation Quality]
A --> F[Claim Quality]
A --> G[Provenance Quality]
B --> B1[JSON parse rate]
B --> B2[Load-to-DB success]
C --> C1[Type constraint pass]
C --> C2[Required property fill]
C --> C3[Illegal edge rate]
D --> D1[Entity P/R/F1]
D --> D2[Alias merge error]
D --> D3[Entity split error]
E --> E1[Triple P/R/F1]
E --> E2[Qualifier accuracy]
E --> E3[Direction accuracy]
F --> F1[Claim correctness]
F --> F2[Conflict detection]
F --> F3[Temporal validity]
G --> G1[Source span hit]
G --> G2[Doc/chunk attribution]
背景
当前 HugeGraph-LLM 已有 GraphRAG 能力,但缺少一个轻量、易用、可复现的评测机制。修改图抽取流程、prompt、召回策略、rerank 逻辑、上下文构造或回答生成逻辑后,很难判断效果是否真的变好,也不容易发现具体退化样例
希望新增一个轻量级 benchmark 能力,方便开发者对 GraphRAG 相关变更进行快速评测。该能力需要同时覆盖图抽取质量和召回质量,对中文场景友好,不依赖过重框架,也不应强制要求外部 LLM 才能完成基础评测
实现前需要调研业内已有 RAG / GraphRAG 评测方案和开源框架,尽量复用成熟思路,减少重复造轮。可以参考已有开源库或方案,例如 RAGAS、DeepEval、ARES、TruLens、GraphRAG-Bench 等,但需要注意部分工具对中文场景支持不佳,或默认依赖 LLM-as-judge / 外部服务,不适合作为基础依赖。最终方案可以借鉴其指标设计、数据格式或报告方式,但应保持轻量、可复现、中文友好
benchmark 可以参考下面的业内常见评估维度,仅供参考。基础能力应优先覆盖“完整性”和“正确性”,后续可以逐步扩展到其他更细维度
本 task 需要独立完成,不依赖其他 benchmark task 或图抽取 task 已经完成。评测可以先基于公开文本、给定样例、期望图抽取结果、检索证据和参考答案进行初步对比;后续更完整的数据集可以单独补充
需求
支持图抽取质量评估
支持召回质量评估
支持 baseline / candidate / 参考答案对比
支持中文和英文样例
本地实验可以可选接入真实 LLM 或 LLM-as-judge,但不能作为基础评测强依赖
核心检查项