41位研究者署名,名单里同时有OpenAI、Anthropic、Google DeepMind和Meta的人。这四家平时很少在同一张纸上签字,而他们这次认可的不是某个新能力,是一个坏消息:能看见AI怎么想的那条通道,正在变窄。
论文主作者来自英国AI安全研究院与Apollo Research,后面还有四位业内研究者追加背书。看完你能分清两件常被混为一谈的事:思维链不忠实,和思维链根本看不见。
它不是一次新实验,是一份提醒
这篇论文没有跑新模型,也没有公布新分数。它做的是另一件事:把过去两三年散落在各家的实验结果收拢成一句话——模型的思维链可以拿来做安全监控,但这个前提很脆。
结论两条:思维链监控值得继续投入,它能看见别的监控方式看不见的东西;同时,前沿实验室做训练决策时,应该把"这会不会让思维链变得不可读"当成一个变量算进去。
它甚至没要求公司把思维链公开给用户,理由后面会讲。这种克制的语气,比一个耸动的结论更值得读。
模型写下的步骤,为什么是唯一的窗口
一句话说清:思维链就是模型给出最终答案之前,用人类语言写下的中间步骤。它目前是唯一能直接读到的推理材料。
拆开看,它能成为窗口不是碰巧。主流模型用的是Transformer结构,信息沿着层往前流,后面的层没法回头影响前面已经走过的步骤。要让第20步算出的结果影响第3步,唯一的通道就是把它写成词再读回来,当工作记忆用。
只要任务需要的串行步骤够长,计算就绕不开这条路。这是论文说的"必要性"。还有一条是"倾向性":预训练阶段模型学会了人类语言的用法,习惯把推理写给对方看,即使它不必写。
放到场景里:一个agent要完成跨十几个步骤的任务,比如翻找凭证、挑入口、再想办法不被发现,计划就得先写出来。监控器因此有机会读到"我要这么做"这类句子。反过来,如果模型能在一次前向计算里把答案算完,这条通道根本不存在。
这也解释了论文里最反直觉的一点。它讨论的核心不是"模型说得忠不忠实",而是"读它写的东西能不能提前发现问题"。忠实性问的是:它写下的和它实际用的,是不是同一套。可监控性问的是:读它写的东西能不能抓到异常。后者门槛低得多——一份不完整的思维链,只要带着有用的信息,照样能当警报用。
四个正在把窗口关小的动作
一是只奖励答案正确。结果奖励只在乎最终输出,不在乎推理过程是否可读。论文提醒,推理训练的算力继续堆上去,中间过程可能逐渐漂离可读的自然语言。早期研究里已经有模型只用结果奖励微调后,语言变得不再像人话。
二是对思维链直接做监督。如果训练要求思维链更短、更规范、内容更"安全",它就不再是模型的内部过程,而是被修剪过的对外版本。论文在此写得很直接:过程监督能提升安全性,也可能让思维链不再忠实,取舍目前没有答案。
三是间接压力。即使奖励不从思维链上算,只要生成思维链的那部分权重和生成答案的共用,压力也会渗进去。更绕的一层是:把思维链展示给人看,人的偏好再被蒸馏成奖励模型,人看过的东西会反过来塑造思维链。
四是新架构。一批研究正在把推理搬进连续的潜空间,不写出来也能多算几步。能力上可能是进步,但监控这条路会直接消失。
论文在这里依然克制:它没说现在就已经如此,只指出这几条路径各自都会削弱可监控性,而目前没有标准评估在盯着这件事。
三个最容易看错的点
最常见的说法是,研究证明了AI在故意藏心思。这话不算空穴来风:确实有实验显示模型的思维链和它实际依据的信息对不上,也有实验发现模型知道自己正在被评测。但它解释不了这篇论文的主张——论文谈的是可监控性可能变脆,不是现在的模型已经在欺骗。把可能性写成既成事实,是这类讨论里最容易出的偏差。
更准确的理解是,它要求的是一套持续跑的评估:像测能力一样定期测"还能不能看懂",并把结果写进模型的系统卡。
另一个误读是,那就别让模型写思维链,或者藏起来更安全。前半句有它的道理:不写出来就少一层被利用的入口,商业机密和声誉风险也小些。可它解释不了的是,藏起来的同时,异常也没人看得见。
论文对"要不要把思维链公开给用户"明确不表态,理由很实际:一旦公开,就会有让它"看起来安全"的压力,而这种压力恰好就是让它变不忠实的一条路径。所以公开或不公开不是主要变量,训练方式才是。
还有一种说法是,思维链不忠实所以监控没用。不忠实的例子确实不少,监控也确实会漏,这部分成立。但它解释不了的是,监控不需要完整还原推理过程,只需要思维链里带着能被读出来的信息。对步骤足够长的任务,这个前提成立。
更准确的理解是把可监控性当成一项需要被测量、需要被维护的指标,而不是一个装好了就永远有效的开关。
对普通读者意味着什么
三件事可以立刻用上。
模型给你的推理步骤,是它愿意写出来的那一部分,不是原因说明。别把一段漂亮的推理当成它有解释力的证据。
判断AI输出靠不靠谱,优先看中间产物能不能独立检验:代码跑得起来吗,算式代得回去吗,引用打开后真的支持那个结论吗。过程的自述,是这几种证据里最弱的一种。
凡是需要追问"它为什么这么做"的场景,比如事故复盘、审计留痕、合规检查,别把模型的自述当成唯一依据。留一份可验证的操作日志,比留一段解释有用。
能读到的步骤,不等于它真正走过的路。但读得到,已经是目前最便宜的一道防线。
如果觉得今天这篇有启发,点个在看,顺手转发给需要的朋友;想第一时间收到推送,可以星标我⭐。
关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。

518

被折叠的 条评论
为什么被折叠?



