如果说大模型(LLM)是企业AI的大脑,那么RAG(Retrieval-Augmented Generation)就是连接企业知识的神经系统。过去两年,几乎所有企业级AI项目,无论是智能客服、知识库问答、金融投顾、法律咨询还是医疗助手,都绕不开一个核心技术——RAG(Retrieval-Augmented Generation,检索增强生成)。那么,RAG到底是什么?为什么所有企业都在做RAG?企业级RAG又是如何设计和优化的?本文将从原理、架构、调优、难点、最新技术发展等多个角度,带你系统理解RAG。
01 为什么会有RAG?
在理解RAG之前,我们需要先理解一个问题:
为什么ChatGPT有时候会一本正经地胡说八道?
举个例子:
假设你问ChatGPT:
“我们公司最新发布的基金产品管理费是多少?”
或者:
“招商银行2026年第一季度净利润是多少?”
GPT为什么回答不出来?
原因很简单:因为它没有这些知识。
LLM(Large Language Model)本质上是在海量公开数据上训练得到的概率模型,它拥有丰富的通用知识,却不知道:
-
企业内部文档
-
公司数据库
-
最新财报
-
新产品说明
-
最新法规
-
客户数据
-
企业业务规则
这些数据根本没有参与模型训练。
于是模型只能:
-
猜测
-
编造
-
回答不知道
这就是大家熟悉的:
Hallucination(模型幻觉)
因此,大模型最大的短板不是推理能力,而是:无法获取最新、真实、私有的数据。
于是RAG诞生了。
02什么是RAG?
RAG,全称:Retrieval-Augmented Generation。
中文翻译:检索增强生成
它的核心思想只有一句话:先查资料,再回答问题。换句话说:
传统LLM:
用户问题
│
▼
LLM直接回答
RAG:
用户问题
│
▼
知识库检索
│
▼
找到相关资料
│
▼
LLM阅读资料
│
▼
生成答案
所以:
真正回答问题的,不再只是LLM,而是:LLM + 企业知识
这也是RAG最大的价值。
03RAG到底解决了什么问题?
企业使用RAG,主要解决以下几个核心问题。
- 解决知识更新问题
重新训练一个几十B甚至几百B参数的大模型,成本极高。
如果今天更新一份制度、增加一个产品、发布一份公告,就重新训练一次模型,显然是不现实的。
RAG则完全不同。
企业只需要:
新增文档
↓
建立Embedding
↓
存入知识库
模型无需重新训练,就可以回答最新内容。
因此:知识和模型实现了解耦。
- 降低模型幻觉
如果没有知识来源,模型只能猜。而RAG会把真实资料放进Prompt,例如:
请严格依据以下资料回答。
资料:
......
问题:
......
模型只能依据资料生成答案,幻觉率会大幅下降。
- 支持企业私有知识
例如:
-
产品说明书
-
招股说明书
-
合同
-
内部制度
-
…
这些知识互联网没有,只能依赖RAG。
04RAG适用于哪些场景?
很多人认为:RAG就是知识库。其实远远不止。目前RAG已经广泛应用于:
企业知识库
例如:
员工提问:差旅报销标准?
AI自动检索制度文档。
智能客服
例如:
客户咨询:我的会员什么时候到期?
系统查询CRM。
回答客户。
金融投顾
例如:
用户提问:最近一年ROE超过15%,PE低于行业平均的新能源龙头有哪些?
系统需要:
查询数据库
↓
查询行业知识
↓
结合财报
↓
生成分析
这里通常需要:
RAG + NL2SQL + Agent
05RAG整体架构
一个真正企业级RAG通常如下:
用户问题->
Query Rewrite
->
Query Embedding
->
Hybrid Retrieval(BM25+Vector)
->
TopK Candidate Documents
->
Rerank排序
->
Context Compression
->
Prompt Assemble
->
LLM
->
最终答案
上述每个步骤对应的工作职责如下表所示:
| 模块 | 中文 | 核心职责 |
|---|---|---|
| User Question | 用户提问 | 用户输入自然语言问题 |
| Query Rewrite | 查询理解与改写 | 把"人话"转换成机器更容易检索的问题 |
| Query Embedding | 查询向量化 | 将文本转换为向量表示,便于计算语义相似度 |
| Hybrid Retrieval | 混合检索 | 综合关键词、语义、元数据等多种方式检索知识 |
| Top-K Candidate Documents | 候选文档召回 | 从知识库中召回最有可能相关的若干文档 |
| Rerank | 精排重排序 | 对召回结果再次排序,筛选真正最相关的内容 |
| Context Compression | 上下文压缩 | 去除冗余信息,压缩上下文,控制Token长度 |
| Prompt Assemble | Prompt组装 | 将问题、检索结果和提示模板组织成最终Prompt |
| LLM | 大模型推理 | 基于Prompt理解、推理并生成回答 |
| Final Answer | 最终答案 | 将可信、自然的答案返回给用户 |
这些步骤看似简单,实际上每一步都有大量优化空间。
06企业RAG到底是怎么做的?
整个流程通常包括以下几个阶段。
第一阶段:数据采集
企业的数据来源十分复杂:
-
PDF
-
Word
-
PPT
-
Excel
-
…
第一步就是统一解析。
第二阶段:文本切分(Chunk)
这是RAG最重要的一步。
例如:一本500页的PDF。不能一次全部Embedding。因此需要切分。
或者按照:章节-> 标题-> 段落-> 语义 进行切分。目前越来越多企业采用:
Semantic Chunking(语义切分)
而不是固定长度切分。
第三阶段:Embedding
Embedding就是:把文字变成向量。
例如:
新能源
↓
[0.23,0.56,-0.71,...]
相似内容,向量距离更近。用户问题也会Embedding。然后进行相似度搜索。
第四阶段:向量数据库
Embedding完成以后,
存入:
-
Milvus
-
FAISS
-
Qdrant
-
Weaviate
-
pgvector
-
Elasticsearch Vector
之后即可快速搜索。
第五阶段:Hybrid Retrieval
现在几乎没人只用向量搜索。企业基本都会:
BM25
+
Dense Vector
+
Sparse Vector
+
Metadata Filter
以上检索方式的作用和擅长解决的问题我已整理好供大家参考如下所示:
| 检索方式 | 中文名称 | 核心作用 | 最擅长解决的问题 |
|---|---|---|---|
| BM25 | 关键词检索 | 根据关键词出现的频率和重要性进行匹配,快速找到包含相同关键词的文档。 | 精确匹配专有名词、股票代码、产品名称、专业术语等关键词。 |
| Dense Vector Retrieval | 稠密向量检索(语义检索) | 将文本转换为语义向量,根据向量距离寻找语义相近的内容,即使文字不同也能检索到。 | 解决同义词、近义词、口语表达、自然语言理解等语义匹配问题。 |
| Sparse Vector Retrieval | 稀疏向量检索 | 兼顾关键词和语义信息,通过稀疏向量表示重要词汇,提高关键词检索的泛化能力。 | 兼顾关键词匹配和语义理解,提升复杂查询和长文本检索效果。 |
| Metadata Filter | 元数据过滤 | 利用文档属性(如时间、部门、类别、作者等)先筛选符合条件的数据,再进行检索。 | 缩小搜索范围,提高检索速度和准确率,避免无关文档参与计算。 |
综合来看:向量适合语义。BM25适合关键词。结合效果最好。
第六阶段:Rerank
Rerank 的作用可以简单理解为:
对第一次检索得到的候选文档进行二次排序,从中挑选出真正最相关的内容。
为什么需要 Rerank?
因为向量检索(Vector Search)或混合检索(Hybrid Retrieval)虽然能够快速召回一批相关文档,但这些文档只是"可能相关",并不一定是最符合用户问题的。
例如,用户提问:
基金收益怎么算?
第一次检索可能返回:
- 基金收益率计算方法
- 基金收益分配规则
- 基金净值计算
- 基金收益到账时间
- 基金收益确认规则
这些文档都包含"基金"和"收益",因此都会被召回。
但真正回答用户问题的,可能只有第一篇。
这时,Rerank 会再次综合分析用户问题与每篇文档的相关程度,对这些候选文档重新排序,把最相关的内容排到最前面,再交给大模型生成答案。
Rerank 的核心作用
| 作用 | 说明 |
|---|---|
| 提高准确率 | 将真正相关的文档排到前面,减少无关内容进入大模型。 |
| 降低幻觉 | 提供更准确的参考资料,使大模型更容易基于事实回答,而不是编造内容。 |
| 减少上下文长度 | 只保留最重要的几篇文档,降低Token消耗,提高推理效率。 |
常见的 Rerank 方法
目前企业级RAG中常见的Rerank方案包括:
| 方法 | 特点 |
|---|---|
| Cross Encoder | 准确率最高,目前企业应用最广泛,但计算速度相对较慢。 |
| ColBERT | 在准确率和速度之间取得较好的平衡,适合大规模检索场景。 |
| BGE-Reranker | 基于BGE系列模型的重排序模型,中文效果优秀,部署简单。 |
| Jina Reranker | 面向多语言和长文本优化,适合企业知识库和国际化场景。 |
一句话总结
如果说检索(Retrieval)的目标是"尽可能不要漏掉答案",那么Rerank的目标就是"从这些候选答案中找出最好的那个"。
在现代企业级RAG中,通常都会采用:
Hybrid Retrieval
│
▼
Top 100 Candidate Documents
│
▼
Rerank
│
▼
Top 5 Documents
│
▼
LLM
也就是说,检索负责"广泛召回",Rerank负责"精准筛选",两者配合才能获得高质量的最终答案。
第七阶段:Prompt构造
中文名称:Prompt构造 / 提示词组装
经过检索、排序之后,系统已经找到了最相关的知识。
但这些知识并不能直接发送给大模型,而是需要按照一定的格式组织起来,这个过程称为 Prompt Assemble(Prompt构造)。
简单来说:
Prompt就是大模型收到的一整段输入,它不仅包含用户的问题,还包含系统角色、检索到的知识、回答要求等信息。
可以理解为:
Prompt = 给大模型的一份"工作说明书"。
Prompt设计得越合理,大模型回答得越准确;设计得不好,即使检索到了正确知识,也可能回答错误。
一个完整的Prompt通常包含哪些部分?
现代企业级RAG中,一个Prompt通常由以下几个部分组成:
组成部分
作用
System Prompt(系统提示)
定义模型的身份、职责和回答原则,例如"你是一名金融分析师"。
Retrieved Context(检索知识)
将RAG检索到的文档内容作为参考资料提供给模型。
User Question(用户问题)
用户输入的自然语言问题。
Instruction(回答要求)
规定回答格式,例如"只能依据资料回答""资料不足时请明确说明""请引用来源"等。
因此,一个完整的Prompt并不仅仅是一句话,而是由多个部分共同组成。
经过RAG检索后,系统可能会构造如下Prompt:
你是一名专业的金融分析师,请严格依据提供的资料回答问题,不得编造任何事实。
Context
资料1:宁德时代2023年研发投入为183亿元,同比增长18%。
资料2:宁德时代2024年研发投入继续保持增长,重点投入动力电池和储能技术研发。
User
宁德时代近三年的研发投入情况如何?
Instruction
请结合以上资料进行总结。如果资料不足,请明确说明。回答尽量简洁,并引用资料来源。
最终,大模型读取的并不是一句"宁德时代研发投入如何",而是这一整段Prompt。
为什么Prompt设计很重要?
很多人认为:
RAG = 检索 + 大模型。
实际上,即使检索到了正确资料,如果Prompt设计不好,也会影响最终回答质量。
例如:
没有限制模型只能依据资料回答,模型可能会自行补充甚至产生幻觉;
没有要求引用来源,用户无法判断答案是否可信;
没有规定回答格式,不同问题可能得到风格完全不同的回复。
因此,在企业级RAG中,Prompt不仅负责"把资料交给模型",还负责约束模型的行为、规范输出格式、降低幻觉风险。
07 2026最新RAG发展方向
过去:大家认为:
Embedding
Vector DB
=
RAG
现在已经完全不是这样。最新RAG开始进入:Agent时代。
下面介绍几个最重要的发展方向。
- GraphRAG
传统RAG:只能找相似文本。GraphRAG:加入知识图谱。
例如:
苹果公司
↓
CEO
↓
供应商
↓
产品
↓
产业链
模型能够沿着关系推理。非常适合:金融、制造、医疗、法律。
- Agentic RAG
过去:用户问一句。检索一次。结束。现在:Agent能够拆解问题。
例如:
新能源板块
利润增长最快
PE最低
机构持仓最高
Agent:拆成多个子任务。逐步查询最后汇总。
- Multi-hop Retrieval
例如:
A公司的供应商是谁?
这些供应商去年利润增长多少?
其中哪些属于新能源?
需要:多轮检索,逐步推理而不是一次搜索。
-
Self-RAG
LLM自己判断:当前知识够吗?不够?继续检索。直到找到足够信息。 -
Corrective RAG(CRAG)
如果发现:检索质量不好自动重新检索重新排序。直到结果满足要求。 -
Long Context RAG
现在很多模型支持:100K 200K甚至100万Token。因此很多企业开始:减少Chunk增加上下文降低切分误差。
08 RAG调优有哪些关键点?
真正决定RAG效果的,往往不是模型,而是检索系统本身。
-
Chunk设计
切得太小上下文丢失。切得太大Embedding质量下降。通常需要:
固定长度切分
标题切分
段落切分
语义切分
滑动窗口(Overlap)
综合使用。 -
Embedding模型选择
Embedding模型决定:语义理解能力。行业Embedding通常优于:通用Embedding。
例如:
金融Embedding。
医疗Embedding。
法律Embedding。 -
Retrieval优化
推荐:Hybrid Search:
Dense
Sparse
Keyword
Metadata
效果最好。
-
Rerank优化
这是企业RAG提升最大的地方之一。Cross Encoder虽然慢。但是排序效果远高于向量距离。 -
Prompt优化
例如:增加:引用来源,禁止编造,输出格式,推理过程,合规风控,责任声明等都会影响效果。 -
Evaluation(评测)
不要只看:LLM回答。企业都会建立:RAG Benchmark。
指标包括:
Recall@K
Precision@K
MRR(Mean Reciprocal Rank)
NDCG(Normalized Discounted Cumulative Gain)
Answer Faithfulness(答案忠实度)
Context Precision(上下文准确率)
Context Recall(上下文召回率)
Hallucination Rate(幻觉率)
Answer Relevancy(答案相关性)
持续优化检索和生成效果。
09 企业落地RAG最大的难点
很多团队认为:接一个向量数据库RAG就完成了。实际上真正困难的是:
数据质量!垃圾数据永远生成垃圾答案。
文档解析:PDF,扫描件,表格,图片,OCR 不同类型的文档准确解析都是难点。
Chunk设计:直接影响召回率。
查询理解:用户一句话。真正意思可能完全不同。需要Query Rewrite。
检索准确率:真正企业项目80%的时间都花在检索优化。而不是LLM。
知识更新:每天新增:文档,公告,制度,如何实时更新。都是挑战。
10 未来RAG的发展趋势
未来的RAG,不再只是"文档检索"。它正在演变成企业AI的知识中枢。
未来企业级AI的典型架构将更加智能:
在这个架构中:
RAG负责获取可信知识;
Knowledge Graph负责组织实体与关系;
Semantic Layer负责统一业务语义;
NL2SQL负责访问结构化数据;
Agent负责规划、调用工具和多步推理;
LLM负责理解问题、综合信息并生成自然语言。
它们共同构成了下一代企业智能系统。
普通人如何抓住AI大模型的风口?
领取方式在文末
2026年入行AI大模型的黄金窗口!!!
AI产业正迎来前所未有的爆发式增长。 从DeepSeek以百万年薪重金招募顶尖研究员,到百度、阿里、腾讯等头部企业加速推进AI Agent商业化布局,再到国家层面持续出台政策,大力扶持数字经济与AI人才培育体系,多重信号清晰指向一个共识:AI的“黄金十年”已全面开启
在产业浪潮的强劲推动下,AI人才争夺战日趋白热化。技术迭代与场景落地双轮驱动,催生海量高价值岗位。放眼未来,AI领域的职业发展前景广阔无垠,正涌现出大量高潜机遇,堪称一片值得深耕的**“人才蓝海”**。
脉脉数据显示📊:
2026年1-2月,AI岗位数量同比增长约12倍,增速远超新经济行业整体增幅;AI岗位在全部新经济岗位中的占比也从2025年同期的2.29%跃升至26.23%,几乎占据新经济招聘市场的四分之一。
与此同时,AI新发岗位平均月薪高达60738元,较新经济行业整体平均月薪48189元高出约26%。
这一切都说明一件事:2026年,正是入行AI大模型的黄金窗口❗️❗️

最佳学习路线
只要你真心想学习AI大模型技术,这份精心整理的学习资料我愿意无偿分享给你,但是想学技术去乱搞的人别来找我!
在当前这个人工智能高速发展的时代,AI大模型正在深刻改变各行各业。我国对高水平AI人才的需求也日益增长,真正懂技术、能落地的人才依旧紧缺。我也希望通过这份资料,能够帮助更多有志于AI领域的朋友入门并深入学习。
真诚无偿分享!!!
vx扫描下方二维码即可
加上后会一个个给大家发
【附赠一节免费的直播讲座,技术大佬带你学习大模型的相关知识、学习思路、就业前景以及怎么结合当前的工作发展方向等,欢迎大家~】

大模型全套学习资料展示
自我们与MoPaaS魔泊云合作以来,我们不断打磨课程体系与技术内容,在细节上精益求精,同时在技术层面也新增了许多前沿且实用的内容,力求为大家带来更系统、更实战、更落地的大模型学习体验。

希望这份系统、实用的大模型学习路径,能够帮助你从零入门,进阶到实战,真正掌握AI时代的核心技能!
01 教学内容

-
从零到精通完整闭环:【基础理论 →RAG开发 → Agent设计 → 模型微调与私有化部署调→热门技术】5大模块,内容比传统教材更贴近企业实战!
-
大量真实项目案例: 带你亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事!
02适学人群
应届毕业生: 无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。
零基础转型: 非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界。
业务赋能突破瓶颈: 传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型。

vx扫描下方二维码即可
【附赠一节免费的直播讲座,技术大佬带你学习大模型的相关知识、学习思路、就业前景以及怎么结合当前的工作发展方向等,欢迎大家~】

本教程比较珍贵,仅限大家自行学习,不要传播!更严禁商用!
03 入门到进阶学习路线图
大模型学习路线图,整体分为5个大的阶段:

04 视频和书籍PDF合集

从0到掌握主流大模型技术视频教程(涵盖模型训练、微调、RAG、LangChain、Agent开发等实战方向)

新手必备的大模型学习PDF书单来了!全是硬核知识,帮你少走弯路(不吹牛,真有用)

05 行业报告+白皮书合集
收集70+报告与白皮书,了解行业最新动态!

06 90+份面试题/经验
AI大模型岗位面试经验总结(谁学技术不是为了赚$呢,找个好的岗位很重要)

07 deepseek部署包+技巧大全

由于篇幅有限
只展示部分资料
并且还在持续更新中…
人工智能大潮已来,不加入就可能被淘汰。如果你是技术人,尤其是互联网从业者,现在就开始学习AI大模型技术,真的是给你的人生一个重要建议!
真诚无偿分享!!!
vx扫描下方二维码即可
加上后会一个个给大家发
【附赠一节免费的直播讲座,技术大佬带你学习大模型的相关知识、学习思路、就业前景以及怎么结合当前的工作发展方向等,欢迎大家~】


2424

被折叠的 条评论
为什么被折叠?



