Skip to content

Latest commit

 

History

16 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 

Repository files navigation

Awesome LLM Knowledge

Awesome

系统整理 LLM 结合外部知识的主要使用范式,涵盖 2020-2026 年的代表性研究工作。

目录


概述

传统 RAG(Lewis et al., 2020)确立了"参数记忆 + 非参数记忆"的二元架构。6 年来,这一单一范式演化为多种并存的知识使用方式。本仓库按以下五大范式组织文献:

范式 核心思想 代表工作
LLM-Powered Indexing LLM 离线提炼知识为结构化表示 GraphRAG, LightRAG, HyperGraphRAG, LLM Wiki, OKF
Vectorless 用推理/关键词/实时搜索替代向量 PageIndex, Sirchmunk
Agentic 检索是多轮决策过程 GlobalRAG, KnowLP
Knowledge as Parameters 知识预压缩为模型参数 Doc-to-LoRA, MeMo
Native Structure Indexing 利用数据的原生结构替代文本解析 PixelRAG, MM-BizRAG, Graphify, DKB

范式一:LLM 驱动的知识提炼(LLM-Powered Indexing)

用 LLM 在离线阶段对文档进行知识提炼,输出为结构化表示(图谱、超图、Wiki 页面等)。核心是"LLM 作为知识构建者"——不同方法的区别在于输出格式和组织方式。

图谱构建(二元关系)

  • GraphRAG (Microsoft, 2024) — 使用 Leiden 算法进行层次化社区检测并生成社区摘要,在全局综合任务上表现优异(72-83% 提升),但索引成本极高(~$33K/次重建)。 [详细解读]

  • LightRAG (北邮/港大, 2024) — 双层检索(Low-level 具体查询 + High-level 抽象查询)结合增量更新机制,单次 API 调用 <100 tokens 完成检索,成本降低数千倍。 [代码] [详细解读]

  • UnWeaver (Samsung AI Warsaw, 2026) — 仅抽取实体(不构建完整图谱),以 1/17 的成本达到 GraphRAG 级效果。核心论点:VectorRAG 几乎就够了,图谱复杂度被高估。 [详细解读]

  • LinearRAG (香港理工, 2025) — 用 spaCy NER 替代 LLM 关系抽取,构建三层图(实体-句子-段落)+ Personalized PageRank 检索。索引零 token 消耗,速度降低 77%+,在 2Wiki 上绝对提升 +3.80%。量化证明 GraphRAG 的关系抽取反而引入噪声。 [代码] [详细解读]

  • FlowRAG (华东师范/上海AI实验室, 2026) — 四层异构图(段落-摘要-句子-实体)+ 双粒度实体激活 + 频率感知加权流。索引比 LightRAG 快 14x,token 消耗仅 2%,平均 GPT-Accuracy 58.89%(+1.72% vs LinearRAG)。 [详细解读]

N元关系与超图

  • HyperGraphRAG (北邮/NTU, 2025) — 用超边表示 n 元关系,突破二元关系限制。信息论证明二元图对 3+ 实体事实必然有损。F1 平均提升 +7.45,构建成本仅 $0.006/1k tokens。 [详细解读]

  • OG-RAG (Microsoft Research, 2024) — 本体约束的超图表示,事实召回提升 55%,回答正确性提升 40%。需要预定义领域本体,适合强监管领域。 [详细解读]

本体驱动的知识约束

  • OMD-GraphRAG (中国联通, 2025) — 本体引导抽取 + 多维聚类 + 双通道融合检索。三个模块各贡献约 3% F1 提升,组合达 +9.21%(vs LightRAG)。证明本体在抽取阶段的杠杆效应最高。 [详细解读]

层次结构索引

  • BookRAG (2025) — 保留文档原生层次结构(章节/节/小节)的索引方法,利用结构关系改善检索精度。 [详细解读]

  • PageIndex (2025) — LLM 构建 JSON 层次索引(ID/名称/描述/子节点),保留文档原生结构供推理导航。(也属于范式二:推理式检索) [详细解读]

  • GlobalRAG (复旦, 2025) — 提出 GlobalQA 基准(13,000+ QA 对),揭示现有方法在全局聚合任务上仅达 1.51 F1。文档级检索 + 智能过滤 + 符号计算工具实现 6.63 F1(+339%)。 [详细解读]

Wiki / 持久化知识格式

LLM 提炼的知识不一定要存为图谱——输出为人类可读的 Wiki 页面,实现知识复用、可审计和人机协同编辑。

  • LLM Wiki (2025, 13.1k stars) — 桌面应用,将文档自动转化为互联 Wiki 知识库。两步 CoT 摄入、Louvain 社区检测、增量缓存、图可视化。知识可读、可审计、可人工修正。 [详细解读]

  • Google Open Knowledge Format (OKF) (Google Cloud, 2026) — 将 LLM-Wiki 模式标准化为供应商中立的开放规范。Markdown + YAML frontmatter + Git,零基础设施投入,从个人工具走向行业标准。 [详细解读]

结构化表格/数据库(Structured Extraction)

LLM 提取文档关键字段存入结构化数据库,使全局聚合类查询(统计/排序/筛选/TopK)可通过 SQL 精确计算。

全局聚合/语料库级推理:

  • GlobalRAG (复旦, 2025) — 提出 GlobalQA 基准(13K+ QA),揭示现有 RAG 在全局聚合任务上仅达 1.51 F1。文档级检索 + 智能过滤 + 符号计算工具实现 6.63 F1(+339%)。证明纯 LLM 无法做精确统计,需要程序化工具辅助。(也属于范式三:智能体驱动) [详细解读]

LLM 驱动的文档关键信息提取:

  • AgenticIE (2025) — Agent 式信息提取框架(planner-executor-corresponder 模式),从复杂监管文档中提取结构化数据。比 GPT-4o 提升 16%(Exact Match 0.396 vs 0.342)。

  • RASG: Retrieval Augmented Structured Generation (IEEE 2024) — 将文档信息提取重构为 LLM "工具调用"问题,涵盖关键信息提取和行项识别。LLM + RASG 匹配或超越当前多模态 SOTA。

  • Source-Grounded Data Generation for Text-to-JSON (2026) — STAGE 框架:LLM 从报告自动生成 JSON schema 并填充结构化数据。

  • MimirRAG (2026) — 金融数据的多 Agent RAG 框架,包含元数据提取、Agent 查询规划和混合搜索。

表单/合同/发票类提取:


范式二:无向量检索 (Vectorless / Embedding-Free)

拒绝"先嵌入-再检索"的预计算范式,用推理、关键词搜索或结构导航替代向量相似度。

推理式检索

  • PageIndex (2025) — LLM 通过 JSON 层次索引逐步推理导航,五步迭代检索。无需向量数据库,理解深层含义并跟踪交叉引用。(也属于范式一:层次结构索引) [详细解读]

关键词/Grep式检索

  • Keyword Search is All You Need (Amazon Science, 2026) — 智能体关键词搜索(rga/pdfgrep)在无向量数据库条件下达到 RAG 90%+ 性能,FinanceBench 上甚至超越传统 RAG。 [详细解读]

  • Is Grep All You Need? (PwC, 2026) — Grep 在 inline 交付模式下一致优于 vector 检索。更换 Agent Harness 的影响 ≈ 更换检索器。证明对精确回忆任务,词法匹配 > 语义匹配。 [详细解读]

实时全文搜索

  • Sirchmunk (ModelScope, 2026) — 开源无嵌入搜索引擎,基于 ripgrep-all(100+ 格式)+ 蒙特卡洛证据采样(探索-利用平衡 + 模拟退火收敛)+ ReAct Agent 容错。FAST 模式 2-5 秒。 [代码] [详细解读]

范式三:智能体驱动的检索与生成

检索不是单次操作,而是多轮决策过程。LLM Agent 自主决定何时检索、检索什么、何时停止。

  • GlobalRAG (复旦, 2025) — LLM + 符号计算工具(计数/极值/排序/Top-K)。证明纯 LLM 在全局聚合任务上失败,需要程序化工具辅助。移除聚合工具后 F1 下降 79.2%。 [详细解读]

  • KnowLP (暨南大学/Griffith, 2025) — GraphRAG 用于个性化学习路径推荐。多智能体协作:P-Agent(前置路径)+ S-Agent(相似绕道)+ D-Agent(难度匹配)。在 Junyi 数据集上比次优方法提升 46.7%。 [详细解读]

  • Is Grep All You Need? (PwC, 2026) — 揭示 Agent Harness 设计比检索算法更关键。工具输出的呈现方式(inline vs file)可以完全反转检索策略的优劣。 [详细解读]


范式四:知识即参数 (Knowledge as Parameters)

不在运行时检索知识,而是将知识预先压缩为模型参数。介于 RAG 和 Fine-tuning 之间的"第三条路"。

  • Doc-to-LoRA (Sakana AI, ICML 2026) — 超网络单次前向传播生成 LoRA 适配器注入主模型,突破原生窗口 4x+ 仍保持接近完美准确率。推理时零额外延迟,但需要访问模型权重。 [代码] [详细解读]

  • MeMo (NUS/东京大学/MIT CSAIL, 2025) — 训练独立的 Memory Model 作为知识载体,主 LLM 完全冻结。支持黑盒 API 模型,噪声鲁棒(±1.77%),多语料可合并(K=10 时 5.5× 计算节省)。 [详细解读]


范式五:原生结构索引(Native Structure Indexing)

当数据有比纯文本更好的原生表示时,直接利用原生结构比转换成文本再处理更有效。核心主张:跳过文本解析,用数据的原生结构(像素布局/AST/类型系统)直接构建索引。

视觉检索(Visual RAG)

跳过 HTML/PDF 解析,直接在像素空间中完成嵌入、检索和阅读。改变了知识的存在形态(文本→图像)、嵌入方式(文本Embedding→视觉Embedding)和阅读方式(LLM→VLM)。

  • PixelRAG (UC Berkeley, 2026) — 将网页渲染为截图,用视觉嵌入模型(Qwen3-VL-Embedding + LoRA)在 30M Wikipedia 截图上检索,VLM 直接从图像阅读。比文本 RAG 提升高达 18.1%,即使在纯文本任务(NQ、SimpleQA)上也更好。 [代码] [详细解读]

  • MAGE-RAG (2026) — 长文档多模态 QA 的自适应图证据框架。构建动态证据图(页面节点+元素节点,编码包含/阅读顺序/布局邻接/语义关系),Agent 在预算约束下迭代选择-扩展-过滤证据子图。LongDocURL 52.75%,MMLongBench-Doc 53.26%。 [代码]

  • MM-BizRAG (ACL 2026 Industry) — 企业级多模态 RAG。针对复杂企业文档(报告/PPT/表格)的结构感知管道:方向特定的摄入流水线(竖版用布局解析,横版用整体表示)+ LLM 驱动的工件转换。比纯视觉基线提升高达 32 个百分点。

  • Multimodal Graph RAG (2026) — 结合多模态知识图谱与 RAG 实现长程视觉文档理解。提出 DLVQA 基准用于文档级视觉 QA,解决需要全文档理解的跨页面视觉问答。

代码索引(Code RAG)

代码有确定性的原生结构(AST、类型系统、import 关系),可直接解析为知识图谱,无需 LLM 抽取。实验证明 AST 确定性图谱在代码场景全面优于 LLM 抽取图谱(更快、更便宜、更完整、零错误)。

  • Reliable Graph-RAG for Codebases: AST vs LLM (2026) — 对比三种代码 RAG 方案(向量/LLM图谱/AST图谱)。AST 图谱(DKB)在 45 题上 43 正确/0 错误,LLM 图谱 38 正确/2 错误且跳过 31% 文件。DKB 索引成本仅 2.25× 基线,LLM 图谱 19-45×。结论:代码场景 AST 确定性解析全面碾压 LLM 抽取。 [代码] [详细解读]

  • Graphify (Graphify Labs, 2025) — 将代码仓库转化为可查询知识图谱的产品化工具。Tree-sitter 解析 36+ 语言,零 API 调用完成代码索引;可选 LLM 语义增强层。Leiden 算法社区检测,输出交互可视化 + 报告 + JSON 图谱。集成 Claude Code, Cursor 等 20+ 平台。LOCOMO Recall@10: 0.497(vs mem0 0.048)。 [详细解读]


工业界知识库产品(Enterprise Knowledge Products)

各大云厂商与商业公司推出的知识库/上下文智能产品。区别于学术论文,这些条目聚焦可落地的托管服务与商业化产品——它们如何为企业 AI Agent 提供受治理、可审计、随使用演化的知识基础设施。

  • AWS Context (AWS, 2026-06, Coming Soon) — AWS Summit NYC 发布的托管知识图谱服务,"automatically maps the relationships across your existing data into a knowledge graph and provides agentic search"。图谱元数据以 Apache Iceberg 格式落地 S3,与 Glue Data Catalog / SageMaker Unified Studio / Lake Formation 打通,由 Amazon Quick 的个人知识图谱扩展为组织级图谱。核心机制:observes which sources produce correct results, which join paths agents rely on, and which curated rules get applied,按实际使用为数据源排名;每次调用继承调用者的 IAM & Lake Formation 权限(Identity-aware and governed by default)。 [详细解读]

  • Microsoft (Fabric + Purview + GraphRAG) (Microsoft) — 全家桶级智能治理体系。以 Microsoft Fabric (OneLake) 为单一数据源(Shortcuts 免搬迁),叠加 Microsoft Research 的 GraphRAG 抽取实体/关系构建全局语义网络。杀手锏是 Purview 的 DSPM for AI:多跳推理时运行时权限审计、输出自动继承敏感度标签、推理路径对审计透明。适合金融/医疗等强合规行业。 [详细解读]

  • Snowflake (CoWork / Cortex Agents) (Snowflake) — 主打数据重力与计算下沉,让 AI 直接进入数仓内部工作。摒弃传统 RAG 的导出-向量化流程,在数据层内运行混合搜索(向量 + 原生 SQL),支持 Deep Research 主-子代理并行工作流。强调受信任边界内计算(数据不外泄)+ 智能路由分发。适合核心业务数据托管在 Snowflake 的企业。 [详细解读]

  • Atlan (Context Graph) (Atlan) — 跨云中立的上下文总线。Context Graph 只管活跃元数据(血缘、语义字典、所有权、使用规范、权限策略),不存原始数据。业内率先原生支持 MCP:Claude / OpenAI / LangChain 代理查询前先经 MCP 调取"长期记忆与治理规则"。适合数据分散在 AWS/Azure/Databricks 的多云企业。 [详细解读]

  • Google (Vertex AI Search and Conversation) (Google) — 搜索级底蕴 + 多模态融合 + 开箱即用。继承谷歌搜索算法并绑定 Gemini,只需给出 GCS 桶或内网 URL 即全托管运行,可解析文字/表格/图表。强调自动溯源(维基式角标链接直达原始 PDF 页面)与低代码。适合海量半/非结构化文档的多模态知识问答。 [详细解读]



数据集与任务类型

不同 RAG 方法适用于不同类型的查询任务。详细整理见 [完整文档]。

任务类型速查

任务类型 典型问题 最佳方法 代表数据集
单跳事实 "X公司的CEO是谁?" 向量RAG / 关键词搜索 Natural Questions, TriviaQA
多跳推理 "A的导师在哪家公司工作?" LightRAG / FlowRAG / HyperGraphRAG HotpotQA, MuSiQue
全局聚合 "薪资最高的5位员工?" GlobalRAG (Doc-level + 符号工具) GlobalQA (13K+ QA)
Schema约束 "符合指南X的治疗方案?" OG-RAG / OMD-GraphRAG Agriculture, Medical
N元关系 "医生X用药物Y治疗患者Z?" HyperGraphRAG 5域×512题自建基准
路径推理 "从A到B的因果链?" PathRAG / FlowRAG HotpotQA, 2Wiki
长文档理解 "第3.2节关于X的例外?" BookRAG / PageIndex / Doc-to-LoRA NarrativeQA, NIAH
精确回忆 "合同第X条原文?" Grep / 关键词搜索 LongMemEval, FinanceBench
时间推理 "X和Y之间发生了什么?" 所有方法均弱(最好 65% F1) MultiHop-RAG temporal

关键发现

  • 检索-生成鸿沟: 检索覆盖 83.5%,LLM 仅利用 47.9%——更多检索 ≠ 更好生成 (AWS+Cisco 2026)
  • 图谱有效区间: 多跳推理(2-3x 提升)和 N 元关系(+7.45 F1)明确有效;单跳事实无收益
  • 图谱可能有害: 关系抽取噪声可使性能低于 vanilla RAG(36-54% vs 62.87% 上下文相关性)

综述与基准


详细解读

每篇文献的详细研究报告在 docs/ 目录下,包含方法细节、实验数据和核心洞察。


贡献

欢迎提交 PR 补充相关文献。请遵循现有格式:

  • README 中添加一行简介(含论文链接、机构、年份、核心贡献)
  • docs/ 中添加详细解读文件

License

MIT

About

No description, website, or topics provided.

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors