背景
已完成 taxonomy v1 的初步实现(3月4日、5日已重处理),当前体系为三维分类(capability/domain/research_type)+ 结构化元数据(base_model/key_technique/primary_benchmark)。
下一步计划
1. 标签体系优化
当前 tag list 过于粗粒度,无法体现具体的研究方向和使用方法。需要:
- 细化 capability 标签:当前 12 个大类太宽泛(如 "Reasoning & Planning" 覆盖了 CoT、ToT、MCTS、ReAct 等完全不同的方法),需要增加二级标签或更具体的方法标签
- 增加方法论标签:体现具体的技术路线,如 RL-based / Prompt Engineering / Fine-tuning / Distillation 等
- 修复分类违规:当前 prompt 约束不够强,偶尔出现
Benchmark/Evaluation 被放入 capability 等跨维度错误(约 3-5% 的概率)
- 标签应能回答:这篇论文用了什么方法?解决了什么具体问题?属于哪个细分研究方向?
2. 前端展示增强
当前详情页只展示 domain 和 research_type 两个 taxonomy 字段,需要更丰富的结构化信息展示:
3. 全量回填
- 剩余 8 天(02/21~02/27, 03/03)共约 420 篇论文待处理
- 预计耗时 ~1.5h(并发4)或 ~70min 串行
- 需要先完成标签体系优化,避免二次回填
相关文件
scripts/reprocess_day.py — 重处理脚本
research/extract_taxonomy.py — taxonomy 原型
web/src/components/paper-detail.tsx — 前端详情页
web/src/types/paper.ts — 类型定义
优先级
标签体系优化 > 全量回填 > 前端展示增强
背景
已完成 taxonomy v1 的初步实现(3月4日、5日已重处理),当前体系为三维分类(capability/domain/research_type)+ 结构化元数据(base_model/key_technique/primary_benchmark)。
下一步计划
1. 标签体系优化
当前 tag list 过于粗粒度,无法体现具体的研究方向和使用方法。需要:
Benchmark/Evaluation被放入 capability 等跨维度错误(约 3-5% 的概率)2. 前端展示增强
当前详情页只展示 domain 和 research_type 两个 taxonomy 字段,需要更丰富的结构化信息展示:
3. 全量回填
相关文件
scripts/reprocess_day.py— 重处理脚本research/extract_taxonomy.py— taxonomy 原型web/src/components/paper-detail.tsx— 前端详情页web/src/types/paper.ts— 类型定义优先级
标签体系优化 > 全量回填 > 前端展示增强