Negative Results Registry for AI Collaboration — 一个结构化的、可检索的"AI 实验失败了"公开登记系统。
语言 / Languages:简体中文(原文) · English · 正體中文
知道什么不 work 和知道什么 work 同等重要。 · 在线浏览
科学界有一个"文件抽屉问题"(file drawer problem):阳性结果发表,阴性结果塞进抽屉。AI 协作领域同样如此——GitHub 上充斥着"我用 AI 做了 X"的展示,但几乎没有人记录"我试了 X,失败了"。
这个登记册旨在对抗"文件抽屉问题"。 它是一个结构化的、可通过 registry.json 机器查询的公开数据库,专门记录 AI 协作中的阴性/诚实结果。当前为维护者个人失败日志的结构化原型,外部条目接入后方可声称社区价值。
- 阴性结果不是失败——是数据
- 诚实建立信任——一个说自己"所有实验都成功"的人要么没做过实验,要么在撒谎
- 知道死胡同的位置,后来人就不会撞墙
- 精确的失败条件比模糊的成功宣言更有信息量
- 目前为维护者个人失败日志的结构化原型——24 条目、同一提交者、同一生态,尚不能声称已"对抗文件抽屉问题";需外部提交和独立条目后才能作为社区登记册
GitHub 上有 1,800 万 AI 相关仓库,其中绝大多数是代码项目——"我用 AI 做了 X"的展示。做一个新工具、新框架、新模型,你一搜能找到几十个竞品。
但这个登记册不是代码项目。 它是一套结构化的方法论数据——24 个条目背后是跨 5 种 LLM 后端、覆盖多个公开项目的独立审查经验。仅 AI 协作框架一个项目就累积了 50+ 轮独立审查,加上其他项目的审查链,总轮次从未统计但远超此数。每个条目中的具体数字(d=0.03, n=24/臂, 33 项发现 0 重叠)都有源文件和审查链可追溯,不是在真空中编造的。
差异化不在代码,在经验密度。 别人可以 fork 这个仓库、复制 Schema、改个名字发布——但写不出条目里的数据。代码可以复制,经验不能。
flowchart TB
SUBMIT["📝 <b>提交者</b><br/>实验失败后<br/>填写提交模板"]
subgraph REGISTRY["<b>登记册</b>"]
SCHEMA["📋 <b>JSON Schema 校验</b><br/>结构完整性 + 分类一致性"]
STORE["🗄 <b>条目存储</b><br/>.md(人读)+ .json(机读)<br/>NRR-YYYY-NNN"]
INDEX["📊 <b>聚合索引</b><br/>registry.json<br/>按领域/类型/模型可检索"]
end
CONSUME["🔍 <b>消费者</b><br/>启动实验前搜索<br/>'有人试过这个方向吗?'"]
SUBMIT --> SCHEMA --> STORE --> INDEX --> CONSUME
CONSUME -.->|"发现前人失败<br/>调整方向"| SUBMIT
| 代码 | 领域 |
|---|---|
| prompt-engineering | Prompt 工程 |
| code-review | 代码审查 |
| methodology-extraction | 方法论提取 |
| workflow-orchestration | 工作流编排 |
| document-generation | 文档生成 |
| multi-model-collaboration | 多模型协作 |
| quantitative-research | 量化研究 |
| academic-writing | 学术写作 |
| tool-building | 工具开发 |
| skill-design | Skill 设计 |
| benchmarking | 基准测试 |
| other | 其他 |
| 代码 | 类型 |
|---|---|
| null-result | 零结果 |
| ceiling-effect | 天花板效应 |
| worse-than-baseline | 劣于基线 |
| failed-to-replicate | 复现失败 |
| methodology-failure | 方法失败 |
| abandoned-dead-end | 死胡同 |
| hypothesis-falsified | 假设被证伪 |
| tool-unfit-for-purpose | 工具不适用 |
| other | 其他 |
详细说明见 methodology.md §分类体系
negative-results-registry/
├── README.md ← 你在这里(三语:EN / zh-Hant)
├── CONTRIBUTING.md ← 贡献指南(三语)
├── CLAUDE.md ← AI 助手项目指令
├── LICENSE ← CC BY 4.0
├── .gitignore · .gitattributes
├── methodology.md ← 分类体系 + 价值论述(三语)
├── registry.json ← 聚合索引(脚本生成,禁止手工维护)
│
├── .github/workflows/
│ └── ci.yml ← CI:Schema 校验 + 链接检查
│
├── schema/
│ └── entry.schema.json ← 条目 JSON Schema (Draft 2020-12)
│
├── templates/
│ ├── submission-v2.md ← 提交模板(推荐)
│ └── submission.md ← 旧版模板(保留参考)
│
├── entries/ ← 24 条目(NRR-2026-001 ~ 024)
│ └── NRR-YYYY-NNN/
│ ├── NRR-YYYY-NNN.md ← 人读报告
│ └── NRR-YYYY-NNN.json ← 机读数据(权威源)
│
├── scripts/
│ ├── generate_registry.py ← entries/ → registry.json
│ ├── validate_ci.py ← Schema + 链接 + 一致性校验
│ ├── check_external_links.py ← 外部链接检查
│ └── update_readme.py ← registry.json → README 自动更新
│
├── docs/
│ ├── index.html ← GitHub Pages 可浏览页面
│ ├── fork-modification-directions.md
│ └── existing-negative-results.md
│
├── en/ ← English translation
├── zh-Hant/ ← 正體中文翻譯
└── _reviews/ ← 独立审查报告(R1 + R2)
- 复制
templates/submission-v2.md - 按模板填写你的阴性结果
- 创建条目目录(用临时标识命名;正式 ID 由维护者分配)
- 放入
.md+.json双件(JSON 按schema/entry.schema.json校验) - 提 Pull Request
| ✅ 欢迎 | ❌ 不适合 |
|---|---|
| Prompt 对照实验中无显著差异 | "我随便试了一下不行"(缺方法描述) |
| 方法论文献提取未达稳定门槛 | 不涉及 AI 协作的纯技术 bug |
| 某工具/模型在特定任务上失败 | 没有记录实验条件的印象式判断 |
| 策略回测中某因子无预测力 | 保密/未公开项目的结果 |
| Workflow 编排中某模式反效果 |
- ❌ 学术论文格式
- ❌ 统计显著性(单案例诚实报告也欢迎)
- ❌ "大失败"——小到"换了个 prompt 反而更差"也可以
当前已收录 24 个条目,覆盖 10 个领域 × 5 种类型(Schema 共 12 领域 × 9 类型),来自 9 个自有公开项目 + 7 个外部来源(学术论文 + 开源项目):
| ID | 来源 | 领域 | 类型 |
|---|---|---|---|
| NRR-2026-001 | prompt-tdd-methodology | Prompt 工程 | 零结果 |
| NRR-2026-002 | prompt-tdd-methodology | Prompt 工程 | 零结果 |
| NRR-2026-003 | methodology-extraction-methodology | 方法论提取 | 方法失败 |
| NRR-2026-004 | docx-pipeline | 文档生成 | 方法失败 |
| NRR-2026-005 | etf-pattern-match-pybind11 | 工具开发 | 天花板效应 |
| NRR-2026-006 | ma-case-study-pipeline | 学术写作 | 方法失败 |
| NRR-2026-007 | claude-skills | Skill 设计 | 方法失败 |
| NRR-2026-008 | docx-pipeline | 代码审查 | 方法失败 |
| NRR-2026-009 | ai-collaboration-framework | 方法论提取 | 方法失败 |
| NRR-2026-010 | ai-collaboration-framework | 文档生成 | 方法失败 |
| NRR-2026-011 | Kohli 2026 / CrossCheck | 多模型协作 | 天花板效应 |
| NRR-2026-012 | ai-collaboration-framework | 方法论提取 | 死胡同 |
| NRR-2026-013 | ai-collaboration-framework | 方法论提取 | 方法失败 |
| NRR-2026-014 | ai-collaboration-framework | 工作流编排 | 方法失败 |
| NRR-2026-015 | ai-collaboration-framework | 代码审查 | 方法失败 |
| NRR-2026-016 | Kuai et al. (2026) | 多模型协作 | 天花板效应 |
| NRR-2026-017 | Nájera et al. (2026) | 多模型协作 | 零结果 |
| NRR-2026-018 | CrossCheck (sburl) | 多模型协作 | 方法失败 |
| NRR-2026-019 | GitNexus | 基准测试 | 方法失败 |
| NRR-2026-020 | PocketFlow | 方法论提取 | 天花板效应 |
| NRR-2026-021 | NPGS | 方法论提取 | 方法失败 |
| NRR-2026-022 | NPGS | 方法论提取 | 方法失败 |
| NRR-2026-023 | etf-pattern-match-pyo3 | 基准测试 | 假设被证伪 |
| NRR-2026-024 | factor-cuda | 基准测试 | 假设被证伪 |
2026 年已有论文为阴性结果的学术价值提供了外部支持。详见 methodology.md §与学术文献的关系。
关键引用:Kohli (2026-05) 证明了"9 个 LLM 评审团 ≈ 2 个有效独立票"——这本身就是一个有量化证据的阴性结果。
docs/fork-modification-directions.md — Fork 后所有可能的修改方向全景分析。含决策树(3 个问题 30 秒定位起点)、8 个方向排序表(按实现门槛)、和 9 条反模式。
- AI 协作项目全生命周期框架 — 本登记册的方法论来源
- Prompt-TDD 方法论 — 初始条目来源(A2/A3 阴性结果)
- 方法论提取方法论 — 初始条目来源(22 项目 0 模式达标)
- 方法论与经验教训手册 — 50 条错题本
更多项目请见 个人主页
- 提交者单一:24 条目全部来自同一维护者。条目中的"第三方分析"指分析者相对于源项目是第三方(分析别人的项目),不表示分析者独立于登记册维护者——Schema V2 已通过
source_authors/analyst/submitted_by三角色区分了这三种身份 - 外部链接检查受限:CI 对 GitHub 和 arXiv 域名的链接检查因平台限速而跳过——这两个域名上的证据链接需人工核查。v0.2.0 已实现按条目分级报告(verified/skipped/broken)
- 检索能力:当前支持按领域/类型/全文关键词筛选(GitHub Pages),但不支持高级全文搜索或 API 导出
- 审核 SLA 待定:ID 分配和证据门槛已在 v0.2.0 中确定;审核响应时间将在首次外部 PR 后根据实际工作流设定,预估 ≤ 1 周
CC BY 4.0。条目内容版权归提交者所有,提交即同意以 CC BY 4.0 发布。
生成模型:DeepSeek-V4-Pro (via Claude Code CLI) · 2026-07-25
本次编辑:DeepSeek-V4-Pro (via Claude Code CLI) · 2026-08-14