Skip to content

Taxonomy v2: 标签体系优化 + 前端展示增强 #4

Description

@CMander02

背景

已完成 taxonomy v1 的初步实现(3月4日、5日已重处理),当前体系为三维分类(capability/domain/research_type)+ 结构化元数据(base_model/key_technique/primary_benchmark)。

下一步计划

1. 标签体系优化

当前 tag list 过于粗粒度,无法体现具体的研究方向和使用方法。需要:

  • 细化 capability 标签:当前 12 个大类太宽泛(如 "Reasoning & Planning" 覆盖了 CoT、ToT、MCTS、ReAct 等完全不同的方法),需要增加二级标签或更具体的方法标签
  • 增加方法论标签:体现具体的技术路线,如 RL-based / Prompt Engineering / Fine-tuning / Distillation 等
  • 修复分类违规:当前 prompt 约束不够强,偶尔出现 Benchmark/Evaluation 被放入 capability 等跨维度错误(约 3-5% 的概率)
  • 标签应能回答:这篇论文用了什么方法?解决了什么具体问题?属于哪个细分研究方向?

2. 前端展示增强

当前详情页只展示 domain 和 research_type 两个 taxonomy 字段,需要更丰富的结构化信息展示:

  • 基座模型:更好的展示方式(如 badge/chip),支持多模型列表
  • Benchmark 列表:论文测试的所有 benchmark,不只是 primary_benchmark
  • Baseline 对比:论文对比的 baseline 方法列表
  • 训练配置:关键训练参数(数据规模、训练策略、硬件需求等)
  • 研究思路抽取:更好的方法论 pipeline 可视化,而非纯文本 QA
  • 标签聚合页:等全量回填完成后重新设计 taxonomy 统计页面

3. 全量回填

  • 剩余 8 天(02/21~02/27, 03/03)共约 420 篇论文待处理
  • 预计耗时 ~1.5h(并发4)或 ~70min 串行
  • 需要先完成标签体系优化,避免二次回填

相关文件

  • scripts/reprocess_day.py — 重处理脚本
  • research/extract_taxonomy.py — taxonomy 原型
  • web/src/components/paper-detail.tsx — 前端详情页
  • web/src/types/paper.ts — 类型定义

优先级

标签体系优化 > 全量回填 > 前端展示增强

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions