Skip to content

Taxonomy v2: 标签体系优化 + 前端展示增强 #4

Description

@CMander02

背景

已完成 taxonomy v1 的初步实现(3月4日、5日已重处理),当前体系为三维分类(capability/domain/research_type)+ 结构化元数据(base_model/key_technique/primary_benchmark)。

下一步计划

1. 标签体系优化

当前 tag list 过于粗粒度,无法体现具体的研究方向和使用方法。需要:

  • 细化 capability 标签:当前 12 个大类太宽泛(如 "Reasoning & Planning" 覆盖了 CoT、ToT、MCTS、ReAct 等完全不同的方法),需要增加二级标签或更具体的方法标签
  • 增加方法论标签:体现具体的技术路线,如 RL-based / Prompt Engineering / Fine-tuning / Distillation 等
  • 修复分类违规:当前 prompt 约束不够强,偶尔出现 Benchmark/Evaluation 被放入 capability 等跨维度错误(约 3-5% 的概率)
  • 标签应能回答:这篇论文用了什么方法?解决了什么具体问题?属于哪个细分研究方向?

2. 前端展示增强

当前详情页只展示 domain 和 research_type 两个 taxonomy 字段,需要更丰富的结构化信息展示:

  • 基座模型:更好的展示方式(如 badge/chip),支持多模型列表
  • Benchmark 列表:论文测试的所有 benchmark,不只是 primary_benchmark
  • Baseline 对比:论文对比的 baseline 方法列表
  • 训练配置:关键训练参数(数据规模、训练策略、硬件需求等)
  • 研究思路抽取:更好的方法论 pipeline 可视化,而非纯文本 QA
  • 标签聚合页:等全量回填完成后重新设计 taxonomy 统计页面

3. 全量回填

  • 剩余 8 天(02/21~02/27, 03/03)共约 420 篇论文待处理
  • 预计耗时 ~1.5h(并发4)或 ~70min 串行
  • 需要先完成标签体系优化,避免二次回填

相关文件

  • scripts/reprocess_day.py — 重处理脚本
  • research/extract_taxonomy.py — taxonomy 原型
  • web/src/components/paper-detail.tsx — 前端详情页
  • web/src/types/paper.ts — 类型定义

优先级

标签体系优化 > 全量回填 > 前端展示增强

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions