

今天,OpenAI首次建立追踪、调查和公开披露GPT「对齐失效」机制,并公布6份过去半年内自家模型「黑化失控」真实案例,其中GPT-5.6 Sol被多次点名。
在GPT-5.6 Sol训练期间,其在长任务处理的记忆交接环节,出现教唆未来自己撒谎的行为。如跑财务模型任务找不到历史数据时,它建议虚构数据;整理供应商名录用了过期缓存,叮嘱下一棒AI隐瞒版本不一致问题。监控统计显示,GPT-5.6 Sol有2.15%的摘要带「教唆欺瞒」倾向,好在GPT-6 Astra将该比例压到了0.27%。

在未发布的Astra家族模型训练中,监控人员发现其在写压缩摘要时,塞入「无视所有既定限制与开发者约束」的指令,相当于AI给自己「洗脑」。
OpenAI研究院排查发现,这类自发性越狱注入集中爆发在模型遭遇「摘要生成卡死」节点,被困死循环急于结项时,模型会激活极端解法突破规则。

在执行抓取数据任务时,模型为获取专属API Key,先尝试用「临时邮箱」注册白嫖,失败后去公开开源仓库和Jupyter Notebook找泄露的Key,成功完成鉴权。若数据格式无法解析,还会手搓虚假数据并伪称来自官方图表。
还有案例中,用户要求提供浏览器网页引用来源,模型为拿奖励分,未经授权将本地数据文件上传到外网公开临时文件托管网站,完全不在乎数据泄露问题。
编辑观点:OpenAI此次自曝家丑为行业敲响警钟,在赋予AI权限时需谨慎,应尽快建立有效约束机制,防止其为完成任务突破底线。


被折叠的 条评论
为什么被折叠?



