Skip to content

Latest commit

 

History

1 Commit

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 

Repository files navigation

Human-readable Experiment Log

一个面向研究决策、而不是面向数字堆积的 Agent Skill。

它把实验记录分成三层:

run artifacts       完整指标、配置、日志与复现信息
       ↓
experiment record   一次研究问题的结果、解释与下一步
       ↓
decision record     真正改变项目承诺的少量决策

目标很简单:几周后回看日志时,能够迅速回答——当时问了什么、证据说明了什么、结论有多可信、下一步为什么这样做,以及原始证据在哪里。

它解决什么问题

常见的“实验日志”会把项目背景、方法说明、训练 telemetry、所有 benchmark 数字、评测实现、历史结果和 roadmap 塞进同一篇文档。信息没有丢,但人无法快速 recap,也无法看清哪些证据真正改变了决策。

research-decision-log 会要求 agent:

  • 正文只保留会改变结论、置信度或下一步的事实;
  • 完整 benchmark 表、普通 train loss、commit、命令、环境和评测细节留在 Raw;
  • 分开写 observation 与 interpretation,不把事后猜测包装成发现;
  • 使用 supports、does-not-support、inconclusive、invalid 明确标记实验状态;
  • 在看结果前记录 prediction 和 decision rule,未预设时如实写 not prespecified;
  • 只有项目默认、范围、停止条件等真正改变时,才新增 decision record;
  • 保持 append-only,用新记录 supersede 旧决策,不回头改写历史。

安装

通用方式(推荐)

需要 Node.js。下面的命令会识别仓库中的 skill,并让你选择 Codex、Claude Code、Cursor、Gemini CLI、GitHub Copilot、OpenCode 等已支持的 agent:

npx skills add SadGare/human_readable_exp_log

安装到指定客户端的用户级目录:

# Codex
npx skills add SadGare/human_readable_exp_log --skill research-decision-log -g -a codex -y

# Claude Code
npx skills add SadGare/human_readable_exp_log --skill research-decision-log -g -a claude-code -y

# Cursor
npx skills add SadGare/human_readable_exp_log --skill research-decision-log -g -a cursor -y

# Gemini CLI
npx skills add SadGare/human_readable_exp_log --skill research-decision-log -g -a gemini-cli -y

更新已安装版本:

npx skills check
npx skills update

这个安装入口来自开源的 skills CLI。skill 本身遵循 Agent Skills 开放规范。安装第三方 skill 前,请先审阅其 SKILL.md 与脚本。

手动安装

克隆仓库后,把 skills/research-decision-log 整个目录复制或软链接到对应位置:

客户端 项目级 用户级
Codex .agents/skills/research-decision-log/ ~/.agents/skills/research-decision-log/
Claude Code .claude/skills/research-decision-log/ ~/.claude/skills/research-decision-log/
Cursor .agents/skills/research-decision-log/ ~/.cursor/skills/research-decision-log/
Gemini CLI .agents/skills/research-decision-log/ ~/.gemini/skills/research-decision-log/
GitHub Copilot CLI .agents/skills/research-decision-log/ 或 .github/skills/research-decision-log/ ~/.agents/skills/research-decision-log/ 或 ~/.copilot/skills/research-decision-log/
OpenCode .agents/skills/research-decision-log/ 或 .opencode/skills/research-decision-log/ ~/.agents/skills/research-decision-log/ 或 ~/.config/opencode/skills/research-decision-log/
Google Antigravity .agents/skills/research-decision-log/ ~/.gemini/config/skills/research-decision-log/

Codex、Cursor、Gemini CLI、GitHub Copilot、OpenCode 与 Antigravity 都能发现开放的 .agents/skills/ 项目目录;Claude Code 使用 .claude/skills/。相关官方说明见 Codex skills、Claude Code skills、Cursor skills、Gemini CLI skills、GitHub Copilot skills、OpenCode skills 和 Antigravity skills。

使用

显式调用最稳定:

Use $research-decision-log to close this experiment from results/summary.csv.

用 $research-decision-log 把这批 L1/L2 结果追加成一条实验记录;完整数字留在 raw。

用 $research-decision-log recap 当前有效决策和下一批实验,不要写项目历史。

也可以直接描述任务。支持 Agent Skills 自动发现的客户端会根据 description 判断是否启用。

skill 提供四种工作模式:

  • plan:结果出现前记录 question、prediction、decision rule 与 validity guards;
  • close:结果出现后追加 observation、interpretation、disposition 与 next action;
  • record decision:为真正改变项目承诺的结论建立独立决策记录;
  • recap:只汇总当前有效决策、开放问题与下一批实验。

示例

## EXP-20260719-01 — Is L1 large enough to compare selection strategies?

`concluded` · `does-not-support` · confidence: `high`

- **Question:** L1 是否保留了足够的通用能力,可用于判断 BIG 与 Random 的优劣?
- **Comparison:** L1、L2 vanilla 相对同一个 full-data baseline 的共享评测结果。
- **Prediction:** L1 应能保留足够能力,用于低成本方向判断。
- **Decision rule:** 只有 vanilla 基本保留 baseline capability profile,该规模才可用于 selection research。
- **Validity guards:** 两个规模使用相同训练 recipe、baseline 和评测套件。
- **Result:** L1 发生广泛能力退化(mean retention 56.03%);L2 基本保留能力(96.46%)。
- **Interpretation:** L1 上的策略差异主要受低数据量 regime 支配,不能支持方法级结论。
- **Decision:** L1 只用于 pipeline smoke test;selection research 最低使用 L2。
- **Raw:** `experiments/l1-validity/summary.csv`, `analysis.md`

这里只保留两个 aggregate,因为它们直接支撑决策。完整 benchmark、subtype、训练日志和 evaluator metadata 仍需保存,但不应挡在读者与结论之间。

仓库结构

skills/research-decision-log/
├── SKILL.md
├── agents/openai.yaml
├── assets/
│   ├── experiment-entry.md
│   ├── decision-record.md
│   └── run-manifest.yaml
├── references/
│   ├── protocol.md
│   └── examples.md
└── scripts/
    └── validate_entry.py

校验一条已经生成的记录:

python skills/research-decision-log/scripts/validate_entry.py path/to/entry.md

校验器只把缺失核心字段视为错误。篇幅、表格和数字数量属于启发式 warning;如果额外信息确实影响有效性或决策,可以保留。

设计边界

这个 skill 不替代 MLflow、Weights & Biases、autoresearch TSV、训练日志或复现清单。它消费这些 raw artifacts,并生成面向研究者的最小决策记录。

它也不规定“正文最多只能有几个数字”。真正的规则是:删掉这个数字后,如果 disposition、解释、置信度和下一步都不变,它就应该下沉到 Raw。

License

MIT

About

A skill for LLM to write better experiment log.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages