1. 项目概述:这不是一个“AI工具”,而是一套可复用的决策操作系统
“The AI Process”这个标题乍看抽象,甚至有点像某本畅销书副标题——但在我过去三年带团队落地37个AI驱动型业务项目的过程中,它早已不是概念,而是每天写在晨会白板上的第一行待办事项。它不指代某个模型、某段代码或某款SaaS产品,而是一套 围绕人类目标闭环运转的结构化工作流 :从模糊的业务痛点出发,经由问题定义、数据探查、方案建模、人工校验、效果归因到机制沉淀,全程由人主导、AI协同。关键词里没有“大模型”“LLM”“RAG”,却高频出现“对齐”“阈值”“兜底路径”“人工复核点”——这恰恰说明,真正跑得通的AI落地,90%的功夫花在算法之外。它适合三类人深度参考:一是业务部门想用AI但被技术黑箱劝退的负责人;二是刚从算法岗转战产研一线的工程师,正苦于模型指标和业务结果之间那道跨不过去的鸿沟;三是独立开发者,在接单时需要一套能向客户清晰解释“钱花在哪、效果怎么算”的交付框架。我见过太多团队把“上AI”等同于“调API”,结果模型准确率98%,上线后客服投诉量翻倍——因为没人定义过“什么才算真正解决了用户问题”。The AI Process的核心价值,正在于把这种隐性共识,变成可拆解、可检查、可交接的显性步骤。
2. 内容整体设计与思路拆解:为什么必须放弃“端到端自动化”的幻觉
2.1 本质是“人机责任边界的动态协商协议”
很多团队在启动AI项目时,下意识默认“流程越自动越好”,于是把全部精力押注在模型性能提升上。但我在为某连锁药店设计慢病用药提醒系统时彻底推翻了这个逻辑:初期版本用BERT微调做用药禁忌识别,F1值达到0.92,可实际运行中,药师反馈“模型总把‘阿司匹林’和‘阿莫西林’标成同类禁忌,但临床中它们的联用规则完全不同”。问题出在哪?不是模型能力不足,而是我们把“医学知识图谱构建”这个强依赖人工判断的环节,错误地交给了纯数据驱动的模型。The AI Process的第一层设计哲学,就是 强制划分人机责任边界 ——它用一张四象限表定义每个环节的主导方:
| 环节 | 人类主导任务 | AI协同任务 | 边界判定依据 |
|---|---|---|---|
| 问题定义 | 明确业务损益点(如:减少处方错误率) | 聚类历史工单,提示高频错误类型 | 损益能否用财务/运营指标量化? |
| 数据标注 | 制定标注规范(含3级置信度标准) | 主动学习筛选高价值样本供人工复核 | 标注结果是否影响法律/合规责任? |
| 模型输出 | 设定业务阈值(如:置信度<0.85必须转人工) | 生成带不确定性估计的预测结果 | 输出错误是否导致不可逆操作? |
| 效果归因 | 设计AB测试分流策略(含灰度比例计算) | 自动计算各维度归因贡献度 | 归因结论是否用于绩效考核? |
这张表不是摆设。我们在医疗项目中规定:所有涉及“用药建议”的输出,必须经过药师二次确认才能触达患者,系统自动记录确认耗时、修改内容、修改理由。三个月后,这些日志反哺优化了模型的不确定性估计模块——这才是真正的“人在环路”(Human-in-the-loop),而非“人在旁观”。
2.2 结构设计拒绝线性流水线,采用“螺旋上升式验证环”
传统AI项目常按“数据→训练→部署→监控”画成直线,但现实中的需求永远在变。The AI Process采用三层嵌套验证环:
-
内环(小时级):沙盒自检
每次模型更新前,必须通过预设的127条“对抗样本”测试集(如故意错别字、缩写歧义、方言表达)。例如针对“高血压患者禁用布洛芬”这条规则,测试集包含:“高血丫患者不能吃布络芬吗?”“BP高的人能用ibuprofen?”——模型必须对所有变体返回一致结果,否则阻断发布。这个环由CI/CD流水线自动执行,失败率超过5%即触发回滚。 -
中环(天级):业务场景快照
每日0点抽取前24小时真实请求的1%作为“场景快照”,人工标注其中500条典型case(如“患者同时有糖尿病和胃溃疡,该推荐哪种止痛药?”)。标注结果不用于重训练,而是生成《当日决策偏差报告》,重点分析模型在哪些临床组合下置信度骤降。这份报告直接同步给医生顾问团,成为下一轮知识注入的输入。 -
外环(周级):损益穿透分析
每周五下午固定2小时,业务、算法、法务三方共同审阅《损益穿透表》。表格核心列包括:- “AI介入环节”(如:分诊建议、用药提醒、随访话术生成)
- “对应业务指标变化”(如:处方审核通过率+3.2%,但患者投诉中“建议太机械”占比升至17%)
- “根因归类”(标注为“知识缺失”“阈值不合理”“交互设计缺陷”)
- “本周改进动作”(如:将“慢性肾病患者用药禁忌”知识条目从3条扩充至11条,并调整置信度阈值从0.8→0.88)
这种设计让团队摆脱了“模型准确率又涨了0.3%”的虚荣指标,直面“患者满意度下降是否由AI话术引发”的残酷问题。某次穿透分析发现,当AI生成的随访话术中出现“请务必”“切记”等强指令词时,65岁以上患者挂断率飙升


224

被折叠的 条评论
为什么被折叠?



