摘要
意图识别是AI获客智能体的核心模块。本文拆解从规则分类到LLM兜底的两级意图识别架构,说明如何在工业级场景下实现0.9以上的识别准确率,以及工程落地中需要处理的边界问题。
一、为什么意图识别是获客智能体的第一道门
在AI获客场景中,用户发来的咨询千差万别:
- “这个多少钱?” → 高意向,准备询价
- “你们做什么的?” → 中意向,了解阶段
- “哦,知道了” → 低意向,随口一问
- “加个微信” → 明确转化信号
- “你们在哪个城市?” → 地理位置确认
如果意图识别错了,后面所有对话策略都会跑偏——把"随便问问"当高意向强推,或者把"准备下单"当闲聊放过,都是致命错误。
因此,意图识别不是一个简单的分类任务,而是整个获客智能体的决策入口。
二、两级架构:规则分类 + LLM兜底
工业级意图识别系统通常采用两级架构:
第一级:规则与轻量分类模型
- 基于关键词匹配的规则引擎(正则、词典)
- 轻量级文本分类模型(BERT小模型、FastText)
- 优点:速度快、成本低、可解释
- 缺点:覆盖不了长尾问法
第二级:大语言模型推理
- 当第一级置信度低于阈值时,把用户输入+上下文发给LLM
- LLM结合对话历史判断真实意图
- 优点:理解能力强、能处理模糊表达
- 缺点:成本高、延迟大
两级的具体差异对比如下:
| 对比维度 | 第一级:规则/分类模型 | 第二级:LLM推理 |
|---|---|---|
| 速度 | 毫秒级,几乎无延迟 | 秒级,延迟明显 |
| 成本 | 极低,可忽略 | 高,按Token计费 |
| 可解释性 | 强,规则和特征可追溯 | 弱,推理过程不透明 |
| 覆盖长尾能力 | 弱,覆盖不了长尾问法 | 强,能处理模糊表达 |
| 适用场景 | 高频、标准化、意图明确的请求 | 低频、复杂、上下文依赖强的请求 |
两级架构的核心价值:用90%的流量走低成本通道,10%的疑难场景走高成本通道,在准确率和成本之间取得平衡。
三个维度组合,形成完整的用户画像。整体分类体系结构如下:
三、意图分类体系
一个完整的获客意图体系通常包含三个维度:
维度一:意向层级
- 高意向:询价、要联系方式、问合作方式
- 中意向:了解产品、对比方案、问案例
- 低意向:闲聊、咨询、无关问题
维度二:业务类型
- 价格咨询
- 功能咨询
- 案例咨询
- 售后咨询
- 投诉/负面
维度三:转化信号
- 明确要留资
- 明确要线下拜访
- 明确要对比竞品
- 犹豫/拖延
三个维度组合,形成完整的用户画像。
置信度阈值分流逻辑可总结为下图:
四、工程实现的关键细节
1. 置信度阈值怎么定?
- 高置信度阈值:0.85以上直接走第一级
- 中间地带:0.6-0.85进入LLM复核
- 低置信度:0.6以下直接走LLM
阈值不是固定的,要根据业务场景调整。高风险场景(比如涉及价格承诺)阈值要高,宁可多花LLM成本也不能误判。
2. 上下文怎么用?
意图识别不是单句判断,要结合对话历史:
- 前3轮对话的用户表达
- 用户已经问过的问题
- 用户的行为轨迹(浏览了哪些页面、停留了多久)
3. 冷启动怎么办?
新业务上线时没有标注数据,通常做法:
- 先用规则引擎兜底
- 人工标注1000-2000条样本
- 训练初始分类模型
- 上线后持续收集人工修正的数据,迭代模型
4. 误判怎么处理?
- 设置人工复核队列:AI判断为高意向但实际并非如此的样本,定期抽检
- 置信度存疑时,宁可降低跟进强度,也不要过度打扰用户
- 建立反馈闭环:人工修正的结果回流到训练集
五、效果评估指标
意图识别系统上线后,用哪些指标衡量?
| 指标 | 含义 | 目标值 |
|---|---|---|
| 准确率 | 识别正确的比例 | >90% |
| 精确率 | 被判为高意向的用户中,真的是高意向的比例 | >85% |
| 召回率 | 所有真实高意向用户中,被识别出来的比例 | >80% |
| 延迟P95 | 95分位的响应时间 | <2秒 |
| LLM调用占比 | 多少比例的请求走到了LLM兜底 | <20% |
精确率比召回率更重要——误判一个高意向客户的成本,远大于放过一个低意向客户。
六、常见误区
误区一:只看准确率,不看精确率
准确率95%看起来很高,但如果精确率只有60%,意味着40%被标记为"高意向"的客户其实是无效的,运营团队会浪费大量时间。
误区二:意图分类太粗
只分"有意向/无意向"两类是不够的。不同意向层级对应不同的跟进策略,分类越细,策略越精准。
误区三:上线后不迭代
用户的表达习惯在变,行业热点在变,意图识别模型需要持续用新数据迭代。三个月不更新的模型,准确率会明显下降。
七、小结
意图识别是AI获客智能体的决策入口。两级架构(规则分类+LLM兜底)是工业级落地的主流方案,核心是在准确率和成本之间做平衡。工程实现的关键不在于模型多先进,而在于:分类体系是否贴合业务、置信度阈值是否合理、误判反馈闭环是否跑通。

1462

被折叠的 条评论
为什么被折叠?



