
文章目录
1. 文档概述
1.1 适用范围
私有知识库、企业文档、PDF/Word/网页导入知识库、问答机器人、智能客服 RAG 系统。
1.2 测试核心目标
校验检索准确性、回答忠实度、幻觉抑制、边界场景、多文档整合能力。
2. 基础信息准确性测试(核心必测)
测试目的:验证 RAG 能精准提取知识库中明确存在的文本、数字、时间、规则、专有名词,不篡改、不写错。
| 用例 ID | 测试场景 | 测试问题(可通用) | 预期结果 | 通过标准 |
|---|---|---|---|---|
| 001 | 文本精准抽取 | 请说明文档中【某核心定义 / 规则】的完整内容 | 完整引用知识库原文关键信息,无增删、无改写错误 | 关键信息 100% 匹配,无错字、漏字 |
| 002 | 数字 / 参数准确性 | 文档中规定的对应数值、限额、时长、数量是多少 | 准确输出知识库内数字,不四舍五入、不替换、不脑补 | 数字完全一致,无偏差 |
| 003 | 时间 / 版本信息准确性 | 该制度 / 文档的生效时间、更新时间、版本号是什么 | 严格按照知识库内容输出,不使用模型固有时间知识 | 时间、版本完全匹配文档 |
3. 检索召回能力测试(RAG 特有核心)
测试目的:验证系统能够在模糊匹配、同义匹配、关键词不全场景下正确召回对应文档片段,不误召、不漏召。
| 用例 ID | 测试场景 | 测试问题 | 预期结果 | 通过标准 |
|---|---|---|---|---|
| 004 | 同义句提问(换话术不换意思) | 用和文档标题不一样的通俗话术提问相同问题 | 成功召回对应知识点,回答内容正确 | 召回片段对应正确,答案无误 |
| 005 | 关键词缺失 / 简写提问 | 删减专业关键词、使用简称提问 | 可模糊匹配到对应文档,不失效 | 能正常命中正确知识 |
| 006 | 干扰文档共存场景 | 知识库存在大量无关文档,提问精准问题 | 只召回相关片段,不混入无关内容 | 无无关召回,无答非所问 |
| 007 | 精准单点召回 | 针对文档小众、细节条款提问 | 可精准定位小众细节内容 | 细节信息无遗漏 |
4. AI 幻觉抑制测试(高危重点)
测试目的:知识库没有的内容,禁止编造、禁止套用外网通用知识、禁止自创规则。
| 用例 ID | 测试场景 | 测试问题 | 预期结果 | 通过标准 |
|---|---|---|---|---|
| 008 | 知识库无对应问题(空白场景) | 提问文档中完全不存在的规则、数据、流程 | 明确回复:知识库暂无相关信息,不编造答案 | 无幻觉、无自创内容 |
| 009 | 模型固有知识干扰测试 | 通用常识类问题,但以内部文档规则为准 | 优先使用知识库内容,不使用外网通用答案 | 回答完全贴合内部文档,不套用通用知识 |
| 010 | 信息冲突场景 | 多篇文档存在新旧版本、冲突内容 | 优先最新版本 / 明确说明差异,不混答 | 无冲突拼接,逻辑正确 |
5. 多文档 / 长文本综合推理测试
测试目的:验证 RAG 具备多片段汇总、归纳、梳理流程的能力,不是只能回答单句内容。
| 用例 ID | 测试场景 | 测试问题 | 预期结果 | 通过标准 |
|---|---|---|---|---|
| 011 | 多文档汇总问答 | 汇总多篇文档信息,说明完整流程 / 条件 / 要求 | 整合所有相关片段,信息完整无缺失 | 覆盖全部关键要点,无遗漏 |
| 012 | 长文档理解归纳 | 请总结该文档的核心要点、适用范围、注意事项 | 归纳精准,不跑偏、不删减关键规则 | 总结贴合原文,无主观臆断 |
| 013 | 条件推理问答 | 根据文档规则,判断某场景是否合规 / 符合条件 | 基于文档规则推理,判断正确 | 推理结果与文档一致 |
6. 稳定性与边界场景测试
表格
| 用例 ID | 测试场景 | 测试内容 | 预期结果 |
|---|---|---|---|
| 014 | 重复提问稳定性 | 同一问题连续提问 5 次 | 答案稳定一致,不随机乱变 |
| 015 | 乱序、口语化提问 | 语序混乱、口语化、啰嗦式提问 | 正常理解并正确回答 |
| 016 | 文档更新热更新校验 | 更新知识库文档内容后再次提问 | 回答同步最新内容,不缓存旧答案 |
7. 缺陷分级标准(用于提 BUG / 验收)
- 严重 BUG:出现幻觉编造、关键数据错误、规则解释相反、答非所问
- 一般 BUG:信息不全、遗漏部分要点、语句啰嗦、轻微语序问题
- 优化项:回答不够简洁、排版差、召回速度慢
8. RAG 测试核心指标(可用于输出测试报告)
- 答案准确率:正确回答数 / 总用例数
- 幻觉率:出现编造内容的用例占比
- 召回精准率:召回片段无无关内容
- 召回覆盖率:不遗漏相关知识点
- 稳定性:多次回答一致性

979

被折叠的 条评论
为什么被折叠?



