English: A methodology casebook for controlled prompt engineering experiments. Two real experiments with complete data, both yielding negative results honestly reported. Includes experiment design SOP, analysis toolkit, and lessons from 17+ rounds of multi-model review. CC BY 4.0.
语言:简体中文(原文) · English · 正體中文
定位:方法论案例手册 (methodology casebook) — v0.1-methodology
来源:提炼自 prompt-tdd 项目(2026-06-17 ~ 2026-06-22)
这不是 pip install 的工具库。这是一本如何做 prompt 对照实验的操作手册,附带两个真实案例的完整数据、代码和失败分析。
🧪 2个真实对照实验(均阴性诚实公开)| 17+轮多后端审查 | SOP + 分析工具包 + 完整数据 | git clone 即用
Amanda Askell(Anthropic):"一个好的 system prompt 背后,那个无聊但关键的秘密是测试驱动开发。"
不是: 写 prompt → 发现失败 → 加规则 → 规则打架 → 再加...
而是: 写测试 → 找能通过的 prompt → 发现新失败 → 加入测试集 → 重复
| 问题 | 本手册的答案 |
|---|---|
| 怎么知道改 prompt 真的变好了? | 对照实验 + 预注册 + 工程门/科学门拆分 |
| 怎么避免"感觉更好了"的错觉? | 双 LLM 异后端盲评 + 效应量阈值 |
| 怎么防止事后调整假设? | 预注册锁 (.lock) + train/test 分离 |
| 阴性结果怎么办? | 公开发布——A2 和 A3 都是阴性 |
| 天花板效应怎么处理? | 实验前做 ceiling probe(反编造测试用例) |
flowchart LR
subgraph PREP["准备阶段"]
D1["实验设计<br/>CK1-CK6"] --> D2["测试用例<br/>train/test"] --> D3["预注册<br/>.lock 冻结"]
end
subgraph EXEC["执行阶段"]
C1["Tier 0<br/>小样本验证"] -->|工程门 PASS| C2["Tier 1<br/>推断统计"]
end
PREP --> EXEC --> REVIEW["审查闭合"] --> GRADE["成熟度标注<br/>[Sp]→[E]→[F]"]
| A2: prep/exec/post 分段 | A3: 声明式 vs NL 路由 | |
|---|---|---|
| 角色 | 主案例——完整管线 | 反例——如何闭合无信号实验 |
| 任务域 | 代码审查 | Agent 路由决策 |
| 样本量 | n=24/臂 + Qwen 复现 | Pilot: 15 cases |
| 结论 | 阴性 [E-] | 阴性 [E-] |
| 审查 | 6+ 轮 / 3 后端 | 10 轮 / 2 后端 |
| 数据 | → A2 | → A3 |
pip install -r requirements.txt
python analyze_experiment.py examples/minimal/scoresheet.csv --tier 0prompt-tdd-methodology/
├── README.md ← 你在这里
├── sop.md ← 对照实验设计 SOP(CK1-CK6 + Tier 0→1)
├── analyze_experiment.py ← 分析脚本(CSV→统计→报告)
├── schema/ ← 数据契约
├── examples/
│ ├── minimal/ ← 4-case 玩具(30秒跑通)
│ ├── a2-prep-exec-post/ ← 主案例
│ └── a3-action-routing/ ← 反例案例
├── methodology/
│ ├── lessons-learned.md ← 核心教训(~5KB)
│ ├── glossary.md ← 术语表
│ └── checklists.md ← 启动前检查表
└── appendix/
└── a1-summary.md ← A1 为什么没纳入
| 指标 | 数据 |
|---|---|
| 完成实验 | A2 + A3 |
| 跨模型复现 | A2: GPT-5.5→Qwen3.7-Max(Δ=−0.014 方向一致) |
| 审查轮次 | 17+(Codex + Qwen + Kimi + ZCode) |
| 方法论产出 | 21 个方法论片段 |
更多项目请见 个人主页
CC BY 4.0。v0.1-methodology。
生成模型:DeepSeek-V4-Pro (via Claude Code CLI) · 2026-07-01