一个面向研究决策、而不是面向数字堆积的 Agent Skill。
它把实验记录分成三层:
run artifacts 完整指标、配置、日志与复现信息
↓
experiment record 一次研究问题的结果、解释与下一步
↓
decision record 真正改变项目承诺的少量决策
目标很简单:几周后回看日志时,能够迅速回答——当时问了什么、证据说明了什么、结论有多可信、下一步为什么这样做,以及原始证据在哪里。
常见的“实验日志”会把项目背景、方法说明、训练 telemetry、所有 benchmark 数字、评测实现、历史结果和 roadmap 塞进同一篇文档。信息没有丢,但人无法快速 recap,也无法看清哪些证据真正改变了决策。
research-decision-log 会要求 agent:
- 正文只保留会改变结论、置信度或下一步的事实;
- 完整 benchmark 表、普通 train loss、commit、命令、环境和评测细节留在 Raw;
- 分开写 observation 与 interpretation,不把事后猜测包装成发现;
- 使用
supports、does-not-support、inconclusive、invalid明确标记实验状态; - 在看结果前记录 prediction 和 decision rule,未预设时如实写
not prespecified; - 只有项目默认、范围、停止条件等真正改变时,才新增 decision record;
- 保持 append-only,用新记录 supersede 旧决策,不回头改写历史。
需要 Node.js。下面的命令会识别仓库中的 skill,并让你选择 Codex、Claude Code、Cursor、Gemini CLI、GitHub Copilot、OpenCode 等已支持的 agent:
npx skills add SadGare/human_readable_exp_log安装到指定客户端的用户级目录:
# Codex
npx skills add SadGare/human_readable_exp_log --skill research-decision-log -g -a codex -y
# Claude Code
npx skills add SadGare/human_readable_exp_log --skill research-decision-log -g -a claude-code -y
# Cursor
npx skills add SadGare/human_readable_exp_log --skill research-decision-log -g -a cursor -y
# Gemini CLI
npx skills add SadGare/human_readable_exp_log --skill research-decision-log -g -a gemini-cli -y更新已安装版本:
npx skills check
npx skills update这个安装入口来自开源的 skills CLI。skill 本身遵循 Agent Skills 开放规范。安装第三方 skill 前,请先审阅其 SKILL.md 与脚本。
克隆仓库后,把 skills/research-decision-log 整个目录复制或软链接到对应位置:
| 客户端 | 项目级 | 用户级 |
|---|---|---|
| Codex | .agents/skills/research-decision-log/ |
~/.agents/skills/research-decision-log/ |
| Claude Code | .claude/skills/research-decision-log/ |
~/.claude/skills/research-decision-log/ |
| Cursor | .agents/skills/research-decision-log/ |
~/.cursor/skills/research-decision-log/ |
| Gemini CLI | .agents/skills/research-decision-log/ |
~/.gemini/skills/research-decision-log/ |
| GitHub Copilot CLI | .agents/skills/research-decision-log/ 或 .github/skills/research-decision-log/ |
~/.agents/skills/research-decision-log/ 或 ~/.copilot/skills/research-decision-log/ |
| OpenCode | .agents/skills/research-decision-log/ 或 .opencode/skills/research-decision-log/ |
~/.agents/skills/research-decision-log/ 或 ~/.config/opencode/skills/research-decision-log/ |
| Google Antigravity | .agents/skills/research-decision-log/ |
~/.gemini/config/skills/research-decision-log/ |
Codex、Cursor、Gemini CLI、GitHub Copilot、OpenCode 与 Antigravity 都能发现开放的 .agents/skills/ 项目目录;Claude Code 使用 .claude/skills/。相关官方说明见 Codex skills、Claude Code skills、Cursor skills、Gemini CLI skills、GitHub Copilot skills、OpenCode skills 和 Antigravity skills。
显式调用最稳定:
Use $research-decision-log to close this experiment from results/summary.csv.
用 $research-decision-log 把这批 L1/L2 结果追加成一条实验记录;完整数字留在 raw。
用 $research-decision-log recap 当前有效决策和下一批实验,不要写项目历史。
也可以直接描述任务。支持 Agent Skills 自动发现的客户端会根据 description 判断是否启用。
skill 提供四种工作模式:
plan:结果出现前记录 question、prediction、decision rule 与 validity guards;close:结果出现后追加 observation、interpretation、disposition 与 next action;record decision:为真正改变项目承诺的结论建立独立决策记录;recap:只汇总当前有效决策、开放问题与下一批实验。
## EXP-20260719-01 — Is L1 large enough to compare selection strategies?
`concluded` · `does-not-support` · confidence: `high`
- **Question:** L1 是否保留了足够的通用能力,可用于判断 BIG 与 Random 的优劣?
- **Comparison:** L1、L2 vanilla 相对同一个 full-data baseline 的共享评测结果。
- **Prediction:** L1 应能保留足够能力,用于低成本方向判断。
- **Decision rule:** 只有 vanilla 基本保留 baseline capability profile,该规模才可用于 selection research。
- **Validity guards:** 两个规模使用相同训练 recipe、baseline 和评测套件。
- **Result:** L1 发生广泛能力退化(mean retention 56.03%);L2 基本保留能力(96.46%)。
- **Interpretation:** L1 上的策略差异主要受低数据量 regime 支配,不能支持方法级结论。
- **Decision:** L1 只用于 pipeline smoke test;selection research 最低使用 L2。
- **Raw:** `experiments/l1-validity/summary.csv`, `analysis.md`这里只保留两个 aggregate,因为它们直接支撑决策。完整 benchmark、subtype、训练日志和 evaluator metadata 仍需保存,但不应挡在读者与结论之间。
skills/research-decision-log/
├── SKILL.md
├── agents/openai.yaml
├── assets/
│ ├── experiment-entry.md
│ ├── decision-record.md
│ └── run-manifest.yaml
├── references/
│ ├── protocol.md
│ └── examples.md
└── scripts/
└── validate_entry.py
校验一条已经生成的记录:
python skills/research-decision-log/scripts/validate_entry.py path/to/entry.md校验器只把缺失核心字段视为错误。篇幅、表格和数字数量属于启发式 warning;如果额外信息确实影响有效性或决策,可以保留。
这个 skill 不替代 MLflow、Weights & Biases、autoresearch TSV、训练日志或复现清单。它消费这些 raw artifacts,并生成面向研究者的最小决策记录。
它也不规定“正文最多只能有几个数字”。真正的规则是:删掉这个数字后,如果 disposition、解释、置信度和下一步都不变,它就应该下沉到 Raw。