如何从主观体验走向可复现实验
建立假设、对照与证据记录,让技术判断可以被复核和复现。
发布 更新 验证
Key findings
关键发现
- 先固定任务定义和成功标准,再选择模型或工具。
- 同时记录成功样本和失败样本,避免只展示最佳结果。
- 结论必须与版本、日期、环境和证据绑定。
一句话结论
一个值得公开的 AI 工程结论,至少要同时留下任务、环境、过程、结果和限制;否则它更接近使用感受,而不是可引用的证据。
最小实验记录
每次实验先创建一张记录表,固定下面六项:
| 字段 | 要回答的问题 |
|---|---|
| 假设 | 你预期什么改变会带来什么结果? |
| 任务 | 模型实际完成的输入与输出是什么? |
| 环境 | 模型、软件、硬件和日期是什么? |
| 对照 | 与什么基线比较,其他变量是否一致? |
| 证据 | 日志、代码、截图或原始数据放在哪里? |
| 限制 | 哪些结果不能被这次实验证明? |
先写成功标准
不要等结果出来后再决定“这次算不算成功”。成功标准应该在运行前确定,并尽量可以被机器或第三方复核。例如,对代码修改任务,可以记录:
必须通过:类型检查、单元测试、生产构建
允许人工修改:仅限文案与样式微调
不允许:忽略失败测试或删除原有断言
同时保存反例
只展示成功样本,会让读者无法判断方法的适用边界。失败记录至少应包含现象、排查路径、根因判断和后续修正。即使暂时没有根因,也应保留未知状态。
本文如何验证
本站用内容集合强制文章填写验证日期、软件版本、证据、局限性和来源。缺少必要字段时,生产构建会失败。它不能保证内容一定正确,但能显著降低遗漏上下文的概率。
下一步
后续会把这套模板用于 Coding Agent 和 RAG 的真实任务评测,并把原始记录与汇总文章分开发布。
证据与材料
局限性与反例
- 本文先给出最小方法框架,还没有覆盖统计显著性与大规模人工评审设计。
- 示例来自本站建设过程,不代表所有 AI 产品的评测流程。
原始资料来源
- Astro Content Collections 官方文档访问于 2026-08-10
推荐引用格式
作者姓名:《如何从主观体验走向可复现实验》,AI 工程手记,2026-08-10 更新,https://nesson.site/articles/reproducible-experiments/