从最小 RAG 到可评测 RAG
逐步引入检索、评测与迭代,把效果提升变成可验证的工程。
发布 更新 验证
Key findings
关键发现
- 先保留一个无检索基线,才能判断 RAG 是否真正带来增益。
- 检索质量和回答质量要分开评估,避免掩盖根因。
- 每个失败样本都应归入可操作的错误类型。
一句话结论
RAG 的第一版不应追求最多组件,而应建立一个能持续回答“哪一步变好了、哪一步变差了”的评测闭环。
四层最小闭环
| 层级 | 最小产物 | 主要问题 |
|---|---|---|
| 问题集 | 真实问题与预期证据 | 系统是否覆盖用户任务? |
| 检索 | 查询、候选片段与排序 | 必要证据是否被找到? |
| 生成 | 回答与引用映射 | 回答是否忠于证据? |
| 评测 | 指标、人工复核与失败分类 | 变化是否真实且可解释? |
为什么保留无检索基线
如果模型本身已经能回答某个问题,RAG 的价值可能体现在时效性、可追溯性或私有数据,而不只是答案正确率。没有无检索基线,就很难区分模型能力与检索系统带来的增益。
分开看检索与回答
回答错误可能来自两种完全不同的原因:必要证据没有进入上下文,或证据已经存在但模型没有正确使用。两者的修复方向不同,因此记录中必须保留检索候选和最终引用。
建立失败分类
最初可以使用四类:查询表达失败、召回失败、排序失败、生成或引用失败。分类不需要一次完美,但要能指导下一轮实验。
当前状态
这是本站首批方法文章之一。真实数据集、脚本和结果将在完成实验后追加到原文,并在更新记录中说明变化。
证据与材料
- 文档内容更新计划
局限性与反例
- 本文描述评测架构,还没有给出真实数据集上的量化结果。
- 不同领域对相关性、忠实度和安全性的权重需要单独校准。
原始资料来源
- Google Search Central — Article structured data访问于 2026-08-10
推荐引用格式
作者姓名:《从最小 RAG 到可评测 RAG》,AI 工程手记,2026-08-10 更新,https://nesson.site/articles/rag-evaluation-baseline/