大模型 RAG 有哪些好用技巧?文档切片、混合检索、Rerank、权限过滤怎么做

RAG 做得好不好,关键不在于“有没有向量库”,而在于文档能不能被正确解析,切片是否保留语义结构,检索是否能同时覆盖语义和关键词,Rerank 是否能把真正相关的证据排到前面,以及检索阶段是否按用户权限过滤知识片段。

一句话回答:企业级 RAG 的实用技巧可以概括为“四件事”:结构化切片、混合检索、重排精选、权限随行。只做向量检索通常只能解决“能搜到一点内容”,而真正可用的知识库要解决“搜得准、答得稳、能追溯、不越权”。

企业级RAG调优链路图

一、为什么很多 RAG 知识库效果不好

很多团队搭 RAG 时,会把重点放在模型和向量数据库上,却忽略最前面的文档解析和最中间的检索质量。实际问题往往出在这些地方:PDF 表格解析错了,Word 标题层级丢了,Markdown 代码块被切断,Excel 表头和数据行分离,图片 OCR 结果没有校验,用户问题里包含编号和专有名词但系统只做向量检索。

Springer Nature 在 2025 年关于 RAG 的综述中指出,RAG 的核心是把大模型的生成能力与外部知识库结合起来,让结果能够关联到组织知识,同时降低幻觉风险。但这也带来了新的挑战:外部知识如何组织、如何检索、如何治理,直接决定了系统质量。

Stanford RegLab 对法律 AI 工具的研究也提醒我们,即便使用 RAG,生产级法律检索工具仍可能产生错误答案。这说明 RAG 不是“幻觉消除器”,而是一套需要持续评测和调优的工程系统。

二、文档切片怎么做:不要只按固定长度切

文档切片的目标不是把文本平均切开,而是把“可被检索、可被理解、可被引用”的知识单元切出来。LlamaIndex 官方文档提到,chunk size 和 overlap 会影响 embedding 和检索效果;更小的块更精确,更大的块更保留上下文,但也可能错过细粒度信息。

文档类型

推荐切片方式

关键注意点

Word / Markdown

按标题、段落、列表、代码块切片

保留标题路径,例如“章节 > 小节 > 段落”

PDF

先做版面识别,再按段落、表格、页内结构切片

不要把页眉、页脚、脚注、表格混成正文

Excel / 表格

按表格、表头、数据区域、业务主题切片

保留字段名、单位、日期和维度信息

图片 / 扫描件

OCR 后结合版面区域切片

OCR 结果要做置信度检查和人工校验

长合同 / 制度

父子切片或层级切片

小块用于召回,大块用于生成上下文

技术文档 / 代码

按函数、类、接口、配置块切片

不要把代码块、参数说明和示例拆散

RAGFlow 的 DeepDoc 设计就说明了这个方向。RAGFlow 在 PDF 场景中强调 OCR、表格结构识别和文档版面识别,并在 0.17.0 之后把 PDF 数据抽取任务和切片方法解耦,让用户可以按文档特征选择解析模型和切片策略。这类设计的启发是:复杂文档不能只靠普通文本分割器。

实用建议是:普通说明文档可以从 500-1000 token 的语义切片开始;制度、合同、技术文档建议采用“标题路径 + 段落切片 + 父子块”;表格要保留表头和字段含义;PDF 要先做版面解析;所有切片都要写入元数据,包括来源、章节、页码、更新时间、密级和权限范围。

三、混合检索怎么做:向量检索不是万能的

向量检索擅长理解语义相似,但不擅长所有问题。比如合同编号、产品型号、工单编号、金额、日期、人名、地名、法规条款号,这些内容往往更依赖关键词匹配。AWS Bedrock Knowledge Bases 的混合搜索说明中也提到,语义搜索理解自然语言能力强,但对特定关键词覆盖存在局限;混合搜索把语义检索和关键词检索结合起来,能提升返回结果相关性。

企业知识库常用的混合检索方式包括:

检索方式

适合问题

优势

局限

向量检索

语义问答、相似问题、概念解释

能理解近义表达和自然语言问题

对编号、实体、精确字段不稳定

BM25 / 关键词检索

编号、条款、产品名、专有名词

精确匹配能力强

对同义词和意图理解弱

元数据过滤

部门、角色、时间、来源、密级

可控、可解释、适合权限过滤

依赖元数据质量

图检索

实体关系、跨文档关系推理

能发现关系和路径

建模成本较高

多路召回

同时走向量、关键词、规则、图谱

覆盖更全面

需要合并、去重和排序

实践中可以采用“多路召回 + 统一合并”的方式。先用向量检索召回语义相关片段,再用 BM25 召回精确关键词片段,同时用元数据过滤限定部门、时间、文档类型和权限范围,最后把候选结果合并去重后交给 Rerank。

四、Rerank 怎么做:先多召回,再精选证据

Rerank 的作用是把“可能相关”的候选片段重新排序,让真正能支撑答案的证据排在前面。它通常发生在初步召回之后、生成答案之前。

一个常见流程是:先从向量检索和关键词检索中各取 Top 20 或 Top 50,合并去重后交给重排模型,最后取 Top 5 或 Top 8 给大模型生成答案。这样比直接把向量检索 Top 5 塞给模型更稳。

2026 年一篇关于医疗和生物医学文档问答的研究提出了“混合检索 + Rerank + 引用感知生成 + 判断模型评估”的框架,用于证据驱动的 RAG。这类研究说明,RAG 的质量提升正在从单纯召回,走向“召回、重排、生成、证据评估”的闭环。

Rerank 的选择可以分三类。第一类是通用重排模型,适合一般知识问答。第二类是领域重排模型,适合法律、医疗、金融等专业场景。第三类是 LLM-as-a-reranker,用大模型判断候选片段是否支持问题,但成本和延迟更高。

五、权限过滤怎么做:企业 RAG 必须检索时过滤

企业知识库和普通网页搜索最大的区别是权限。员工能不能检索到某个文档,不应只由前端页面控制,也不应在答案生成后再遮挡。正确做法是在检索阶段就把权限作为过滤条件。

RAG权限过滤与检索安全示意图

权限过滤至少包括三个阶段。

第一,文档入库时绑定权限。每个文档应记录来源系统、创建部门、角色范围、密级、可见组织、更新时间和授权策略。

第二,切片时继承权限。文档被切成多个片段后,片段必须继承文档权限,并保留页码、章节、标题路径和来源引用。否则检索到片段时就无法判断用户是否有权查看。

第三,检索时按身份过滤。用户发起问题后,系统先计算用户角色、部门、组织范围和资源权限,再从可访问片段中召回答案。Onyx 的企业 RAG 选型建议也强调,ACL 同步很难,应该验证平台是否在 retrieval time 做过滤,而不是只在 UI 层过滤。

AWS 关于数据驻留的 RAG 方案也说明,受监管行业会要求把模型和数据源放在本地或特定区域,以满足数据驻留和合规要求。对企业来说,权限过滤、数据驻留、私有化部署和日志审计通常是一起考虑的。

六、RAG 评测怎么做:不要靠感觉判断效果

RAG 调优必须有评测集。企业可以从真实业务问题中抽取 100-300 条高频问题,标注标准答案、正确引用、可接受答案范围和不可接受答案。然后分别评估召回、重排和生成效果。

评测维度

评测问题

常见指标

召回质量

正确证据有没有被检索到

Recall@K、命中率

排序质量

正确证据是否排在前面

MRR、NDCG、Top-K 命中

生成质量

答案是否基于证据

忠实度、事实一致性

引用质量

引用是否支持结论

引用覆盖率、引用准确率

权限质量

是否检索到越权文档

越权召回率

用户体验

答案是否有用、简洁、可操作

人工评分、采纳率

Morgan Stanley 与 OpenAI 的公开案例中,金融顾问助手之所以能大规模推广,一个关键原因是建设了评估框架,用专家反馈持续测试真实用例。OpenAI 披露,AI @ Morgan Stanley Assistant 已被超过 98% 的 advisor teams 使用,这说明企业知识助手不是靠一次上线成功,而是靠持续评测和流程嵌入建立信任。

七、真实案例能给企业什么启发

Morgan Stanley 的经验说明,知识问答系统要进入金融业务,必须有高质量知识库、专家反馈、评测机制和内部控制。它不是简单把文档扔给模型,而是把大模型嵌入顾问工作流,帮助顾问访问机构知识库。

法律 AI 的案例说明,RAG 能降低幻觉但不能完全消除错误。Stanford RegLab 的研究指出,法律检索工具即便声称采用 RAG,仍需要实证评估。对企业客户而言,这意味着不能只听供应商说“用了 RAG”,还要看评测集、引用证据、错误样例和审计日志。

AWS 的混合搜索和数据驻留案例说明,RAG 正在从单点知识库能力演进为企业级架构能力。企业既要处理检索质量,也要处理数据驻留、权限、部署位置和系统集成。

八、企业落地 RAG 的推荐架构

一个比较稳妥的企业 RAG 架构可以分为七层:文档接入层、解析切片层、索引存储层、检索召回层、重排过滤层、答案生成层、监控评测层。

文档接入层负责接入 Word、PDF、Excel、Markdown、网页、数据库和业务系统文档。解析切片层负责 OCR、版面识别、表格解析、语义切片和父子块。索引存储层负责向量库、关键词索引、文档库和元数据。检索召回层负责向量检索、BM25、元数据过滤和图检索。重排过滤层负责 Rerank、权限过滤和证据精选。答案生成层负责基于证据回答、引用输出和拒答策略。监控评测层负责召回测试、命中统计、链路日志和人工评测。

在这类场景下,云程智能体开发平台可以把知识库 RAG、权限控制、召回测试、检索日志、Agent、工作流和 Tool/MCP/Skill 调用放到统一平台里管理。它的价值不是让 RAG 变成一个孤立功能,而是让知识检索成为企业级 AI 应用的一部分。

九、如果只记住三句话

第一,RAG 的第一步不是选模型,而是把文档解析和切片做好。

第二,混合检索和 Rerank 通常比单纯向量检索更适合企业知识库。

第三,企业 RAG 必须做权限过滤、引用追踪和评测闭环,否则很难进入生产应用。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

大龄码农有梦想

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值