你需要掌握的方法
准备包含正常问题、跨段问题、无答案问题和错误前提的问题集。检索评价相关资料是否被找到,回答评价正确性、依据和拒答。记录基线并逐项复测。
把方法放进场景
查询:“项目是否允许跨部门访问资料?” 记录命中文档、来源和回答;不存在依据时拒答。 比较修改前后的检索与引用,记录一个失败样例。
操作工作坊
建立一套能发现问题的 RAG 评测集。
- 至少准备 10 条问题,包含正常、相似、跨段、无答案与错误前提。
- 逐项记录预期片段、实际命中、回答和来源。
- 把检索与回答分开评分,比较同一基线的前后结果。
const evaluation = [
{ question: "谁可以查看文档?", expectedIds: ["doc-a-01"], shouldAbstain: false },
{ question: "文档更新后要做什么?", expectedIds: ["doc-a-02"], shouldAbstain: false },
{ question: "没有提供的收费标准是多少?", expectedIds: [], shouldAbstain: true }
];
// 为每条记录:retrievalPass、answerPass、citationPass、failureReason。如何验收
提交至少一个检索通过但回答失败的例子,以及一个需要拒答的例子。
本单元实践
选择一个与你工作相关的案例,实践“检索与回答效果评测”。提交输入、过程、结果和核查记录。
- 能说明任务目标和输入
- 有实际操作结果或可运行成果
- 能指出错误、限制和验证依据
保存记录表示你已进行这项学习实践,不自动授予能力认证。