Skip to content

Repository files navigation

项目简介

功能

针对学术研究中的信息过载问题,设计轻量化混合检索增强生成(RAG)系统,解决传统检索方法在语义理解深度与检索效率间的平衡难题。

创新点

  • 基于Adaptive RAG这篇工作的思路,为了平衡处理检索效率提升准确度,提出了一种轻量化的,基于查询复杂度的动态路由机制(打分器)。 使其能够结合打分器和检索模型,自适应区分简单与复杂查询,减少计算开销的同时保持高准确性。
  • 为确保思维深度及答案置信度,提出DeepSeek-R1及DeepSeek-V3可切换自适应模块作为生成器。

项目说明

  • 这是一个开源项目的改进版本,数据处理及检索器部分沿用原始开源项目作者提供的idea。
  • 数据集采用 arXiv Dataset
  • 采用ColBERTv2对清洗后的数据建立索引,并存储到colbert文件夹中(处理后的索引文件没放到Github中,参考数据处理脚本自行处理即可;数据清洗脚本我重写了下放到了dataset.py
  • 说明正在施工中 ... TBD

项目架构图

架构图

项目展示

TO DO

  • 决策部分,添加查询论文被引量并按照被引量排序功能
  • 添加MoE部分,引入推理增强模型deepseek-reasoner(能力更强但代价高)采用混合专家模型(MoE),通过稀疏激活策略优化资源分配。

项目资源

arXiv Dataset

https://www.kaggle.com/datasets/Cornell-University/arxiv/data

ColBERTv2 RAG sample

https://www.kaggle.com/code/artemenon/arxiv-cs-rag-query-cs-papers-using-colbertv2

Adaptive-RAG

https://arxiv.org/pdf/2403.14403

peS2o

https://hf-mirror.com/datasets/allenai/peS2o

致谢

About

A RAG Bot that can help u with paper reading

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Used by

Contributors

Languages