背景
当前 HugeGraph-LLM 已支持基于 graph schema 从文本中抽取 property graph,但整体效果仍有明显提升空间。主要问题包括:实体或关系漏抽、边方向或 endpoint 错误、schema 外字段、属性类型不稳定、chunk 间重复实体合并不足、LLM 输出格式不稳定,以及成本 / latency 难以评估。
本任务目标不是在现有实现上做小修小补,而是效果优先地实现一套 Schema-based 图抽取能力。现有实现只作为 baseline 和参考,开发者可以选择增量改进、重构核心流程、新增策略,甚至替换当前抽取方案。只要最终方案在可复现评测中证明更好,并且接口迁移成本可控、代码可维护即可。
下面是一个参考流程示意,不限定具体实现方案:
flowchart TD
A["text(s)"] --> B["split chunks"]
B --> C["LLM extract<br/>prompt = chunk + schema + examples"]
S["schema<br/>labels / props / endpoints / primary keys"] --> C
C --> D["parse JSON<br/>vertices + edges"]
D --> E["schema filter<br/>valid labels / props / shape"]
E --> F["normalize<br/>vertex IDs + edge endpoints"]
F --> G["graph result<br/>vertices[] + edges[]"]
Loading
本 task 需要独立完成,不依赖其他 benchmark task 已经完成。评测可以先基于公开文本、给定样例和期望参考答案进行初步对比;后续更完整的数据集可以单独补充。
需求
输入:
输出:
vertices;
edges;
可选的 info/debug 信息。
重点优化目标:
抽取“完整性”;
抽取“正确性”;
输出稳定性;
多 chunk 相同实体“合并/消歧/归一”;
在保证效果的情况下,进一步优化 latency 和 cost。
需要支持与 baseline 或参考答案对比,可以在相同 schema 下的其他 chunk/text 进行复现。
允许使用任意合理技术路线,包括但不限于:
schema-based prompt;
多阶段/多模式抽取;
validation / repair;
entity resolution;
chunk-level / document-level merge;
self-check / review loop;
RBO/CBO + LLM 结合;
rule / dictionary / schema-aware candidate matching / optional NER / LLM verification 等 hybrid 方案。
如采用 hybrid extraction 方案,默认安装不应引入明显重型依赖,大型 NER 模型或额外 NLP 框架应保持 optional。不能在没有可复现评测证据的情况下默认替换原策略,并需要说明该方案适合和不适合的场景。
不能只凭少量 demo case 宣称提升,必须提供可复现的对比结果。
核心检查项
背景
当前 HugeGraph-LLM 已支持基于 graph schema 从文本中抽取 property graph,但整体效果仍有明显提升空间。主要问题包括:实体或关系漏抽、边方向或 endpoint 错误、schema 外字段、属性类型不稳定、chunk 间重复实体合并不足、LLM 输出格式不稳定,以及成本 / latency 难以评估。
本任务目标不是在现有实现上做小修小补,而是效果优先地实现一套 Schema-based 图抽取能力。现有实现只作为 baseline 和参考,开发者可以选择增量改进、重构核心流程、新增策略,甚至替换当前抽取方案。只要最终方案在可复现评测中证明更好,并且接口迁移成本可控、代码可维护即可。
下面是一个参考流程示意,不限定具体实现方案:
本 task 需要独立完成,不依赖其他 benchmark task 已经完成。评测可以先基于公开文本、给定样例和期望参考答案进行初步对比;后续更完整的数据集可以单独补充。
需求
输入:
输出:
重点优化目标:
需要支持与 baseline 或参考答案对比,可以在相同 schema 下的其他 chunk/text 进行复现。
允许使用任意合理技术路线,包括但不限于:
如采用 hybrid extraction 方案,默认安装不应引入明显重型依赖,大型 NER 模型或额外 NLP 框架应保持 optional。不能在没有可复现评测证据的情况下默认替换原策略,并需要说明该方案适合和不适合的场景。
不能只凭少量 demo case 宣称提升,必须提供可复现的对比结果。
核心检查项