Skip to content

[Task] 效果优先的 Schema-based 图抽取功能实现 #74

Description

@imbajin

背景

当前 HugeGraph-LLM 已支持基于 graph schema 从文本中抽取 property graph,但整体效果仍有明显提升空间。主要问题包括:实体或关系漏抽、边方向或 endpoint 错误、schema 外字段、属性类型不稳定、chunk 间重复实体合并不足、LLM 输出格式不稳定,以及成本 / latency 难以评估。

本任务目标不是在现有实现上做小修小补,而是效果优先地实现一套 Schema-based 图抽取能力。现有实现只作为 baseline 和参考,开发者可以选择增量改进、重构核心流程、新增策略,甚至替换当前抽取方案。只要最终方案在可复现评测中证明更好,并且接口迁移成本可控、代码可维护即可。

下面是一个参考流程示意,不限定具体实现方案:

flowchart TD
  A["text(s)"] --> B["split chunks"]
  B --> C["LLM extract<br/>prompt = chunk + schema + examples"]
  S["schema<br/>labels / props / endpoints / primary keys"] --> C

  C --> D["parse JSON<br/>vertices + edges"]
  D --> E["schema filter<br/>valid labels / props / shape"]
  E --> F["normalize<br/>vertex IDs + edge endpoints"]
  F --> G["graph result<br/>vertices[] + edges[]"]
Loading

本 task 需要独立完成,不依赖其他 benchmark task 已经完成。评测可以先基于公开文本、给定样例和期望参考答案进行初步对比;后续更完整的数据集可以单独补充。

需求

  1. 输入:

    • graph schema;
    • 待抽取文本。
  2. 输出:

    • vertices;
    • edges;
    • 可选的 info/debug 信息。
  3. 重点优化目标:

    • 抽取“完整性”;
    • 抽取“正确性”;
    • 输出稳定性;
    • 多 chunk 相同实体“合并/消歧/归一”;
    • 在保证效果的情况下,进一步优化 latency 和 cost。
  4. 需要支持与 baseline 或参考答案对比,可以在相同 schema 下的其他 chunk/text 进行复现。

  5. 允许使用任意合理技术路线,包括但不限于:

    • schema-based prompt;
    • 多阶段/多模式抽取;
    • validation / repair;
    • entity resolution;
    • chunk-level / document-level merge;
    • self-check / review loop;
    • RBO/CBO + LLM 结合;
    • rule / dictionary / schema-aware candidate matching / optional NER / LLM verification 等 hybrid 方案。
  6. 如采用 hybrid extraction 方案,默认安装不应引入明显重型依赖,大型 NER 模型或额外 NLP 框架应保持 optional。不能在没有可复现评测证据的情况下默认替换原策略,并需要说明该方案适合和不适合的场景。

  7. 不能只凭少量 demo case 宣称提升,必须提供可复现的对比结果。

核心检查项

  • 新方案可以独立启用,且能与 baseline 对比。
  • 现有基础使用方式不被无说明破坏;如有 breaking change,需要提供迁移说明。
  • 覆盖正常抽取、无效输出、schema 外 label、schema 外 property、属性类型错误、edge endpoint 缺失、edge 方向错误、重复 vertex / edge、多 primary key、多 chunk 合并等测试。
  • 提供评测报告,包含质量、latency、调用次数、token / cost,如果可获取。
  • 报告中必须包含失败样例分析。
  • 至少满足以下改进之一:
    • 综合 F1 相比 baseline 提升 xx% 以上;
    • F1 下降不超过 10% 的前提下,latency 或 cost 降低 30% 以上。
  • 文档说明新方案的使用方式、适用场景和已知限制

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions