目录
前言
从ChatGPT、Claude到国产的文心、通义、豆包,大模型软件在两三年里完成了从实验室产品到大众工具的跨越。这类软件带来的不只是新功能,而是一种全新的软件范式:传统软件里,开发者把业务逻辑写成确定的代码,用户点按钮,系统返回确定结果;大模型软件里,系统的核心"逻辑"是一个概率模型,用户用自然语言表达意图,系统生成一个未必逐字相同、但语义合理的回答。
这个范式转变改变了一切——需求分析的方式变了(从画流程图变成设计提示词),系统的边界变了(模型自身就是一个有通用能力的"大脑"),连验收标准都变了(同样输入不再保证同样输出,测试用例从"断言相等"变成"评价质量分布")。这也意味着传统软件工程的许多经验依然有效(解耦、监控、灰度、容灾),但它们要围绕一个"会犯错的智能核心"重新组织。
本文从功能架构、核心模块、产品设计、技术实现、挑战与趋势五个方面(展开为七章),系统拆解大模型软件的功能体系。
1. 功能架构:接入层、能力层、基础层
1.1 三层划分与价值定位
大模型应用虽然形态各异,架构上却可以归纳为清晰的三层:
| 层次 | 职责 | 典型组件 |
|---|---|---|
| 接入层 | 承接用户交互与外部调用 | Web对话窗、移动APP、API网关、IDE/浏览器插件 |
| 能力层 | 封装可复用的AI能力 | 多轮对话、文本/代码/图片生成、文档理解、逻辑推理 |
| 基础层 | 提供模型与数据底座 | 大模型服务、向量数据库、工具集成、安全审核 |
三层划分的意义在于帮助团队想清楚自己的产品到底在哪一层创造价值。绝大多数应用方不需要自己训练基础模型,而是在能力层做编排(把对话、检索、工具调用组合成业务流程),在接入层做体验。模型可以随时替换,真正构成业务壁垒的是私域知识库、提示词资产和沉淀下来的工作流——这三者都长在应用方手里。

1.2 用户视角的四类功能
从用户视角看,这些能力又表现为四类功能:对话类(问答、闲聊、角色扮演、心理陪伴)、生成类(写作、写代码、营销文案、方案初稿)、理解类(文档总结、代码审查、图片OCR与识图、合同要点抽取)、辅助类(翻译、润色、改写、格式转换)。值得注意的是,同一个底层模型,靠提示词和编排就能呈现为完全不同的产品——客服机器人和编程助手背后可以是同一个模型,差别全在外围的系统设计。
2. 核心模块之一:对话管理与提示词工程
2.1 无状态模型与会话实体
对话管理要解决的问题是"模型怎么记住你们聊到哪了"。大模型本身是无状态的——它不会记住上一次请求,所谓多轮对话,是应用把历史消息按角色(system/user/assistant)组装好,每次请求重新发给模型。会话因此成为一个独立实体:有标题、有消息列表、可搜索、可删除、可重命名,标题通常由首轮提问自动概括生成;历史消息落库时要区分用户消息、模型回复、工具调用记录和系统事件,为后续的审计和重放留出结构。
2.2 上下文窗口有限:截断、摘要与外挂记忆
真正的工程难点是上下文窗口有限。模型一次能处理的token有上限(从几千到上百万不等),长对话必然超窗,常见策略有三:截断(只保留最近若干轮,简单但丢失早期信息)、摘要压缩(用模型把早期对话总结成几百字再置于开头,保留主线但损失细节)、外挂记忆(把历史事实存入检索系统,按需召回相关片段,容量近乎无限但依赖检索质量)。成熟产品会三者混用:近期对话原文保留、中期对话摘要压缩、关键事实外挂存储。此外还要精确统计每条消息的token消耗,它既是上下文管理的依据,也是计费依据,不同模型的分词器各不相同,token计数必须调用对应模型的分词器而不能想当然按字数估算。
2.3 提示词:大模型时代的"编程语言"
提示词(Prompt)是大模型时代的"编程语言"。系统提示词定义AI的角色、行为边界和输出格式——“你是法律顾问,只回答劳动法问题,拒绝其他领域,回答需引用法条并给出结构化结论”,这一段文字的约束力直接决定产品的专业度和安全性。工程上,提示词不会散落在代码里,而是集中管理:为翻译、总结、代码审查等高频场景制作带变量的模板(如{style}、{language}),存入提示词库支持版本管理、效果评估和A/B对比,线上改一句提示词应该像改配置一样可灰度、可回滚。提示词从个人技巧变成团队资产,是AI应用走向成熟的标志。
3. 核心模块之二:知识库(RAG)
3.1 从文档到答案的四段流水线
大模型的知识有两个硬伤:训练数据有截止日期,且不掌握企业内部信息。RAG(检索增强生成)是当前最主流的解法——先检索私有知识,再让模型基于检索结果回答。它的完整流水线分四段:第一段是知识导入,支持PDF、Word、Markdown等文档上传、网页抓取和数据库同步;第二段是知识加工,长文档按语义切成数百字的片段(chunk),调用Embedding模型把每个片段转成高维向量,连同原文写入向量数据库并建立索引;第三段是检索,用户问题同样向量化,在向量库中做相似度搜索召回候选片段,实践中还要用关键词检索补充向量检索容易漏掉的专有名词和数字,再用重排序模型对候选片段精排;第四段是注入,把最相关的若干片段拼进提示词,要求模型"仅依据以下材料回答,材料中没有的内容要明说不知道"。

3.2 可溯源、可治理:RAG的真正价值
RAG的价值不仅是答得准,还在于可溯源和可治理:回答可以标注引用了哪份文档的哪一段,用户点击即可核对原文,这在法务、医疗、政务场景是刚需;知识更新只需更新文档库而不必重新训练模型,几分钟即可生效;错误答案也能定位到具体材料,修正文档就修正了答案。它的效果瓶颈往往不在模型,而在文档切分质量(表格和跨页段落容易切坏)、元数据过滤(按部门、权限、时间筛选,防止员工检索到无权查看的材料)和检索召回率,这些需要建立可持续的评测集来持续调优,而不是上线即终点。
4. 核心模块之三:工具调用与Agent
4.1 Function Calling:让模型从"会说"到"会做"
光会说不会做的AI价值有限,工具调用(Function Calling)补上了"行动"这条腿。开发者把外部能力描述给模型——工具名称、功能说明、参数格式;模型判断用户意图后,并不直接编造答案,而是输出一个结构化的调用请求(如"调用天气工具,参数city=北京,date=明天");应用执行真正的API调用,再把结果交回模型组织成自然语言回答。搜索、查天气、读数据库、发邮件、执行代码,都通过这套机制接入。工程上必须守住两条线:工具的输入参数要做校验和清洗(模型可能生成幻觉参数),工具必须有明确的权限边界,文件删除、资金操作、对外发送这类高危工具要么不开放,要么要求用户二次确认并全程留痕。
4.2 Agent:自主循环与人在环中
当模型能够自主地"规划→选工具→观察结果→继续规划"循环执行时,产品形态就从"聊天机器人"进化为Agent(智能体):给它一个"调研三家竞品并生成对比报告"的目标,它会自己拆解步骤、多次搜索、读写文件、最终产出文档。当前Agent的主要短板是长链路可靠性——步骤一多就可能跑偏或在错误结果上继续推理,错误还会沿链条放大。因此成熟产品普遍采用"人在环中"设计:关键节点让人确认(发邮件前预览、付款前审批),把Agent限定在可回滚、可验证的任务范围内,并为每一步保存完整轨迹,失败时可以从断点重跑而不必从头再来。
5. 产品设计:为"概率性"而设计
5.1 流式输出:标配的交互语法
大模型软件的交互设计有一套全新语法。流式输出是第一项标配:模型生成一个长答案可能要十几秒,等全部生成完再显示等于让用户盯着白屏,因此答案必须逐字蹦出。技术上服务端通过SSE(Server-Sent Events)把token流推给浏览器,逐字渲染;SSE基于HTTP、实现简单、天然适配"服务器单向推"的生成场景,只有需要双向实时交互(如语音对话)时才需要WebSocket。配套的交互还有"停止生成"按钮(用户发现方向不对可随时中断,同时中止后端计费)、“重新生成”(对概率性结果给出第二次采样)、答案复制与分享,以及代码块语法高亮和Markdown渲染。

5.2 错误处理、个性化与信任设计
错误处理也要重新设计。网络错误提示重试,模型服务过载提示稍后再试,触发内容安全策略时应说明"哪类内容不合规"并引导修改,而不是给一个莫名其妙的拒绝;模型答非所问时,“换个问法"的示例提示比单纯报错有用得多。个性化方面,应用可以记住用户的语言偏好、专业程度和长期事实(如"我是儿科医生,解释时默认使用专业术语”),但记忆什么、何时使用、如何删除,必须对用户透明可控,提供一张"AI记住了我的什么"的清单比任何隐私协议都更能建立信任。引用来源、置信度提示、"AI生成"标识,则属于这个时代新的信息伦理基础设施。
6. 技术实现:选型、成本与安全
6.1 模型路由、降级与成本控制
模型接入层的关键词是路由与降级。不是所有任务都需要最强最贵的模型:寒暄分类用小模型,深度分析才调旗舰模型;系统按任务类型和用户等级路由到不同模型,主模型故障或限流时自动切换备用模型和备用厂商,保证服务不断。成本控制由此展开:每次调用精确计量prompt和completion的token数,按用户和功能维度做配额与计费;高频相同问题引入语义缓存(相似问题直接命中缓存答案);长文本先做摘要再入模;图片理解等高成本能力按场景开关。这些措施组合起来,常常能在不损失效果的前提下把账单压低一半以上。
6.2 向量库选型与双向内容安全
向量数据库是基础层的另一项关键选型,常见方案各有定位:Milvus适合自建大规模集群,Pinecone是全托管云服务,Chroma和pgvector适合原型与轻量场景;检索加速依赖HNSW、IVF等近似最近邻索引,工程上还要解决Embedding模型版本升级后存量向量重建、多租户数据隔离的问题。安全侧则需要双向审核:输入侧过滤提示词注入攻击(用户诱导模型泄露系统提示词、越权调用工具或污染知识库)和违规内容,对外部写入知识库的内容也要消毒;输出侧过滤模型产生的有害信息和企业敏感数据泄露。结合用户认证、功能权限、token配额和完整审计日志,构成AI应用的治理底座。
7. 挑战与趋势
7.1 当前绕不开的四个挑战
当前大模型软件有四个绕不开的挑战,也各有应对方向:
| 挑战 | 表现 | 主流应对 |
|---|---|---|
| 幻觉 | 一本正经地编造事实、引用不存在的法条 | RAG溯源、关键场景人工复核、要求模型给出处 |
| 成本 | 高频调用token费用高昂 | 大小模型分级、语义缓存、摘要压缩 |
| 安全 | 输出违规、提示词注入、数据泄露 | 双向内容审核、工具权限隔离、敏感数据脱敏 |
| 延迟 | 长答案等待感强 | 流式输出、模型推理优化、边缘部署 |
幻觉是其中最具行业特殊性的一个:传统软件的错误是"系统坏了",大模型的错误往往"看起来无比自信",因此所有关键业务都必须把模型输出定位为"草稿"而非"结论"。
7.2 四个清晰的演进趋势
向前看,四个趋势已经清晰。多模态让模型同时理解和生成文字、图片、语音、视频,拍照解题、语音助手、视频理解正在成为标配;Agent化让AI从回答问题走向完成任务,软件的使用方式可能从"人操作界面"演变为"人下达目标";个性化让模型基于长期记忆提供贴身服务,同时也把隐私问题推到台前;垂直化则在医疗、法律、金融等专业领域展开——用行业语料和知识图谱驯化通用模型,以专业可靠性而非通用流畅度取胜。

结语
大模型软件的本质,是把一个概率性的通用推理引擎,通过提示词、知识库和工具调用约束成一个可靠的业务系统。它的功能体系因此围绕五件事构建:对话管理维持上下文,提示词工程定义行为,RAG注入可信知识,工具调用与Agent赋予行动力,安全与成本体系保证它可以规模化运营。
对工程团队来说,最重要的认知转变是接受"不确定性"并学会与之共舞:用检索和引用约束幻觉,用流式和可中断改善等待,用评测体系(而不是单次试用)衡量效果,用人在环中兜住Agent的可靠性边界。模型会持续变强、变便宜,但私域知识、业务流程和用户信任仍然握在应用开发者手里——把这三件事做深,就不必担心被一次模型升级颠覆。
参考资料
- Prompt Engineering Guide,https://www.promptingguide.ai
- LangChain 官方文档,https://python.langchain.com
- 《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》,Lewis et al.
- Pinecone Learning Center(向量检索与RAG实践)
- OpenAI Function Calling / Claude Tool Use 官方文档
260

被折叠的 条评论
为什么被折叠?



