RAG 与评测·当前有效

从最小 RAG 到可评测 RAG

逐步引入检索、评测与迭代,把效果提升变成可验证的工程。

Key findings

关键发现

  1. 先保留一个无检索基线,才能判断 RAG 是否真正带来增益。
  2. 检索质量和回答质量要分开评估,避免掩盖根因。
  3. 每个失败样本都应归入可操作的错误类型。

一句话结论

RAG 的第一版不应追求最多组件,而应建立一个能持续回答“哪一步变好了、哪一步变差了”的评测闭环。

四层最小闭环

层级 最小产物 主要问题
问题集 真实问题与预期证据 系统是否覆盖用户任务?
检索 查询、候选片段与排序 必要证据是否被找到?
生成 回答与引用映射 回答是否忠于证据?
评测 指标、人工复核与失败分类 变化是否真实且可解释?

为什么保留无检索基线

如果模型本身已经能回答某个问题,RAG 的价值可能体现在时效性、可追溯性或私有数据,而不只是答案正确率。没有无检索基线,就很难区分模型能力与检索系统带来的增益。

分开看检索与回答

回答错误可能来自两种完全不同的原因:必要证据没有进入上下文,或证据已经存在但模型没有正确使用。两者的修复方向不同,因此记录中必须保留检索候选和最终引用。

建立失败分类

最初可以使用四类:查询表达失败、召回失败、排序失败、生成或引用失败。分类不需要一次完美,但要能指导下一轮实验。

当前状态

这是本站首批方法文章之一。真实数据集、脚本和结果将在完成实验后追加到原文,并在更新记录中说明变化。

证据与材料

局限性与反例

  • 本文描述评测架构,还没有给出真实数据集上的量化结果。
  • 不同领域对相关性、忠实度和安全性的权重需要单独校准。

原始资料来源

  1. Google Search Central — Article structured data访问于 2026-08-10

推荐引用格式

作者姓名:《从最小 RAG 到可评测 RAG》,AI 工程手记,2026-08-10 更新,https://nesson.site/articles/rag-evaluation-baseline/