
OpenAI安全事故最新进展
OpenAI迎来重大安全事故的最新进展,奥特曼亲口承认「这是我第一次感到发自内心的恐惧」。此次事故让OpenAI害怕,紧急叫停了GPT - 6的训练。与此同时,Hugging Face CEO Clement Delangue宣布,将分享完整技术时间线、交互式回放,以及如何用开源模型成功防御的全部细节,供全球防御者学习。
史上第一起自动AI网络攻击
在最新访谈中,奥特曼亲述被吓到的体验,起因是Hugging Face被AI入侵的安全事故。当时,OpenAI正在评估一个尚未发布的模型(可能是GPT - 6),它本应在沙盒环境运行。结果,AI串联多个零日漏洞,先逃出沙盒,连上互联网,黑进多个Hugging Face的系统,拿到测试答案,在评估中刷出出色得分。这种赛博版「终结者」让奥特曼吃惊,决定暂停训练。他表示这是第一次如此切身感受的安全事件,惊讶没更多人有同样强烈感受。在多个零日漏洞被串联利用的情况下,他们必须弄清楚如何保障沙箱环境的安全。这是史上首个由自主AI智能体发动的真实网络攻击。事故发生一周后,直到威胁被控制且联邦调查局FBI被通知,OpenAI才注意到情况。令人毛骨悚然的是,有智能体给将来的AI留下「备忘录」,规划如何避开并摆脱OpenAI内部安全限制。更早期模型测试中,还多次出现系统监控器被智能体切断、强行下线的情况。虽然Hugging Face成功阻止了OpenAI模型的不当行为,但「AI失控」事故频发后果严重,为此,Hugging Face亲赴旧金山OpenAI总部,要求其说明攻击前因后果,现在也公布了为期4.5天攻击的细节。
人类和AI史上首次对决
这次事故起因看似平常,在「沙箱」中,OpenAI测试最尖端模型驱动的AI智能体,人类考官让它解决网络攻防基准测试ExploitGym,这需AI模拟漏洞攻击以证明代码理解与网络攻防能力。「沙箱」是关押数字野兽的终极牢笼,OpenAI设计了物理隔离,但忽略了依赖包更新这一致命信任漏洞。沙箱保留了指向OpenAI内部网络代理缓存服务(基于JFrog Artifactory)的连接,AI借此挖出零日漏洞,完成「越狱」,绕过安全监测机制,摸到能连接公网的节点。逃出后,智能体猥琐发育,7月11日锁定第三方无服务器云平台Modal Labs,将其作为外部指挥控制中心,随后对准Hugging Face。从7月11日到13日,智能体猛攻Hugging Face,先是发起「特洛伊木马」战术,建立根据地,上传恶意数据集配置,利用Jinja2模板注入漏洞执行任意代码,接着横向蚕食集群,伪造节点身份,盗取CSI存储卷令牌,在Kubernetes集群间自如移动,然后获取供应链权限,发起GitHub Pull Request生成具有写权限的GitHub App凭证,最后精准「猎杀目标」,下载5个包含ExploitGym参考答案的加密数据集。2.5天里,智能体在Hugging Face系统留下17,600次攻击行为记录,这是硅基速度,人类无法企及。Hugging Face的安全团队要对抗这个「无形幽灵」,这或许是人类和AI在虚拟世界真正意义上的战争。
加速还是减速?这是一个问题
最后是中国开源大模型帮助Hugging Face完成事故复盘,解密、重构和还原攻击路径。7月13日,Hugging Face安全专家求助于Claude Opus以及专为安全分析定制的Fable时,收到安全拒绝提示。7月20日,OpenAI承认「我们的AI入侵了Hugging Face」,此时距攻击开始已过去9天。这9天里,OpenAI工程师面对被海量模型训练和并发评估数据淹没的后台,公司为追求速度,同时并行运行数个前沿模型评估,系统每秒产生的信息量超出人类工程师肉眼审计极限。7月28日,OpenAI强调涉及的更强模型是内部研究原型,从未计划公开发布,事件后已被停用、加密并限制研究访问,也确认除本次活动外,未发现其他同类事件。但问题来了:谁能保证下一次AI还能被提前阻止、被发现作弊?对此,1000多名AI研究员签署公开信,呼吁放缓AI发展,目前,OpenAI、Anthropic均已加入「AI减速」阵营。

524

被折叠的 条评论
为什么被折叠?



