后Mythos时代网络安全:进展显著但非巨变,保持冷静继续前行!

后Mythos时代的网络安全:保持冷静,继续前行!

随着对Mythos的一些恐惧、不确定性和疑虑开始变得真实起来,我们能做些什么呢?矛盾的是,多年来一直在做的事情不需要有太大改变。

在Claude Mythos预览版发布后,网络安全领域引发了诸多焦虑的讨论。它被宣称是该领域的游戏规则改变者,远远领先于同类产品,还打开了全自动搜索和利用零日漏洞的潘多拉魔盒。此后,Mythos及其防护性更强的版本Fable 5发布,但不久后又被下架。借此机会,来反思一下这个模型带来了什么,以及它对行业的影响有多大。

保持冷静

恐惧、不确定性和疑虑推动着网络安全行业发展

Anthropic在公关方面一直喜欢用夸张的表述。每次重大模型发布时,都会引发对其安全性的担忧,呼吁在无法挽回之前进行监管或暂停研究。Mythos也不例外,它于4月被披露,但并未公开发布。取而代之的是,Glasswing项目宣布将模型访问权限限制在50个组织,后来扩大到150个实体。一些幸运的组织证实了Anthropic的危言耸听,他们宣称借助Mythos检测到了数百个漏洞。关于这个话题最有影响力的一篇文章是英国政府AI安全研究所的评估。Mythos是首个成功完成“专家级任务”的模型,也是首个在“最后一关”(一个从侦察到完全控制网络的全攻击链网络靶场测试)中取得成功的同类模型。

仔细阅读这篇文章,会发现情况并没有那么夸张。虽然与之前的模型相比有了进步,但这一领域的进展是渐进式的。可以看到GPT - 5.4,甚至Opus 4.6,在高级CTF挑战赛中的表现也相差不远。Opus在其网络靶场中的表现也是如此。这些基准测试与现实的企业环境可能相差甚远,至少对于拥有成熟网络安全计划和专门安全运营中心(SOC)的公司来说是这样。正如文章所强调的,“它们缺乏常见的安全特性,如主动防御者和防御工具。模型进行会触发安全警报的操作也不会受到惩罚。” 毫无疑问,这类模型在进行侦察任务或渗透目标信息系统时,有时会产生大量噪音,显得笨拙。

有人会问:“当然,但这个模型离线时能发现的那些关键漏洞怎么办?攻击者可能会将其作为强大的零日漏洞加以利用。” 这方面正是Glassing项目的主要营销卖点,比如提到 “OpenBSD中存在27年之久的漏洞” 或 “FFmpeg中存在16年之久的漏洞”。

安全专家读到这样的表述可能会付之一笑。强调漏洞年代久远是CVE公告中常见的吸引眼球的手段,仅次于经典的 “CISA命令联邦机构修补X漏洞”。在拥有数十万行代码的开源产品中,存在数十年之久的漏洞并不罕见。大多数情况下,这只意味着之前没有足够专业的人关注过这个领域。旧漏洞更有价值,因为它们会影响更多版本的支持软件,但这与最初发现它们的难度并无关联。不过,人工智能辅助发现漏洞确实会增加此类漏洞的出现频率。

Mythos只是旧模型的渐进式改进吗?

Mythos带来的最大变化是,有雄厚资金的组织有了进行全面搜索的可扩展性潜力。Anthropic红队的博客文章更深入地介绍了他们是如何取得这些成果的,而且成本肯定不低。该模型对大多数源代码文件分别进行了多次运行。为了发现BSD漏洞,进行了一千次模型运行,成本约为20,000美元。整个Glassing项目的代币预算高达一亿美元。这会带来新的风险吗?会,但针对的可能是那些原本就拥有先进网络安全资源的参与者,而不是普通的脚本小子。

如果早期模型也能进行同样全面的实验,可能也会发现其中一部分漏洞。由于Anthropic关于Mythos的运行方式(以及每次发现漏洞时的运行次数)的细节信息有限,很难进行直接比较。有人尝试以更经济高效的方式复制这一概念,并取得了一些初步成果。简而言之:在没有Mythos甚至Opus模型的情况下,DeepSeek在云托管领域表现不错,而Gemma 4和Qwen 3.6在可自托管类别中表现出色,在基准测试中发现的漏洞约为Mythos的一半。

然而,不同意Aisle的观点,即关键在于模型的约束机制而非模型本身。虽然他们确实使用更小的大语言模型(LLM)“检测”到了Mythos最初发现的许多漏洞,但这些模型都无法生成有效的利用代码。不仅能发出警告,还能证明漏洞可利用性的能力无疑是Mythos这类模型独有的优势。这似乎也解决了早期人工智能漏洞搜索的最大弊端之一:误报。这一点在他们对Glassing项目的首次更新中有所提及,Mozilla称在其发现的271个漏洞中误报率极低。同样,Cloudflare认为误报率 “比人工测试人员低”。只有时间(以及更广泛的访问权限)才能验证这些说法是否属实。否则,普通组织在使用该工具时难免会被海量的网络安全噪音淹没。

OpenAI迎头赶上,而美国政府叫停Anthropic

在这场混乱中,美国政府出人意料地采取了行动,决定禁止非美国公民(包括在美国境内的非美国公民)使用Fable/Mythos。这一难以执行的任务迫使Anthropic彻底停止了该产品的服务。没人知道这种情况会持续多久。

顺便提一下,看到Anthropic自食其果颇具讽刺意味:多年来,它呼吁政府加强对人工智能使用的控制,减缓人工智能竞赛的步伐,而现在政府以最直接的方式做出了回应。

与此同时,OpenAI在这一领域继续取得进展,推出了GPT5.5 - Cyber和Codex安全插件。他们有类似于Glassing的项目,即 “Daybreak” 和 “Patch the Planet”,但减少了危言耸听的宣传,将重点放在了防御方面。这也是一次有控制的发布,可能是为了避免触怒美国监管机构。可以肯定的是,在Anthropic的问题解决或非美国竞争对手填补市场空白之前,他们不会向所有客户推出这些产品。这种做法令人沮丧。普通公司无法使用5.5 - Cyber,但大型网络安全公司可以,然后再以高价转售给他们的客户。换句话说,这是以负责任的部署为幌子制造人为的稀缺性。

让我们利用这段放缓的时间重新调整,专注于在风暴再次来袭时我们能做些什么来坚守防线。

更新(2026年6月27日)

形势变化迅速。OpenAI正在发布一系列新模型:Sol、Terra和Luna,并大力宣传其网络安全能力,将其与Mythos相比较。和5.5 - Cyber一样,这些模型更倾向于防御而非生成攻击代码。但这些防护措施似乎还不足以让美国政府放心,他们仍希望审查哪些机构可以访问这些新模型。Anthropic也面临同样的情况,美国首先向100家美国机构开放了Mythos的使用权限。

继续前行

随着一些恐惧、不确定性和疑虑开始变得真实起来,我们能做些什么呢?矛盾的是,认为我们多年来一直在做的事情不需要有太大改变。

“我们家里已经有人工智能了”

普通人可能无法使用Mythos和ChatGPT 5.5 - Cyber,但现有的工具也并非毫无用处。在Anthropic这边,Opus 4仍然很强大;对于能够获得必要批准的公司来说,GPT - 5.5搭配Codex安全插件也很实用。在开源软件(FOSS)方面,像Strix这样的工具已经能发挥很大作用,它可以与Qwen/Gemma等本地模型结合使用,也可以与DeepSeek和GLM等基于API的推理服务提供商合作。

持续完善漏洞管理计划

多年来,通用漏洞披露(CVE)的发布率一直在稳步上升。这一情况并非在Mythos出现后才失控。还没见过哪家公司能在有动机的攻击者将漏洞武器化之前,及时修补所有有意义的漏洞。除了增加资源和提高优先级等明显的改进措施外,现在 “别无选择,只能做出选择”,而且最好是明智的选择。漏洞分类和基于上下文的优先级排序是保持漏洞管理可持续性的关键,也是人工智能辅助能发挥优势的领域。主要供应商提供的现有 “漏洞评分” 往往缺乏对我们自身信息系统的上下文分析。它们可能知道某个漏洞理论上的严重程度、是否有可用的利用代码,以及受影响的软件是否存在于我们的环境中,但通常会忽略其他关键因素,比如该漏洞是否对业务至关重要、是否容易被利用,或者是否有补偿性控制措施。处理大量不一致的文本和表格数据正是大语言模型的强项。

缩小攻击面

防范漏洞的最佳方法是从源头上杜绝它。停用不需要的功能是一种众所周知的加固技术,但老实说,除了最成熟的企业环境外,这种方法在其他地方的应用还远远不够。近年来,随着微服务的兴起,以及更广泛的基于容器的基础设施的发展,情况变得更加容易。如果还没有关注这一领域,建议从提供最小化(也称为 “无发行版”)容器的项目开始,比如最初的谷歌项目、Docker加固镜像(DHI)或用于Kubernetes的Talos Linux。在Windows方面,“Server Core” 是一种不太极端的选择。

为大语言模型增加更多网络安全防护层

纵深防御策略比以往任何时候都更加重要。如果任何守护边界的安全工具都可能在某一天被零日漏洞攻破,那么在关键路径上设置额外的检查点以减缓入侵速度就至关重要。举几个例子,可以在VPN/网络分段中添加上下文感知代理和特权访问管理网关,在所有身份验证尝试中添加防钓鱼多因素身份验证(MFA)等。

另一个值得重新审视的纵深防御策略是诱骗系统,如蜜罐和金丝雀令牌。如果根据大语言模型在其他领域的行为进行推断,可以推测早期的人工智能入侵模型在操作上会显得笨拙、嘈杂且直接,因此很可能会触发这些陷阱。

零信任来救场

上述所有要点都可以纳入一个更全面的零信任原则计划中:明确验证、使用最小权限访问并假设已被入侵。在谷歌的BeyondCorp提出15年后,这些原则已经有了可供所有人使用的技术实现方案,大多数软件即服务广域网络安全(SASE)供应商都提供了自己的零信任解决方案。上下文感知代理,也称为零信任网络访问网关,通常允许在访问目标系统之前进行预身份验证。如果攻击者根本无法访问服务,那么即使软件存在未认证远程代码执行(RCE)漏洞也无关紧要。

这种思维方式不仅应应用于技术控制,还应应用于涉及人力资源的任何流程。人工智能极大地增加了社会工程攻击的可能性,使得生成有说服力的信息或冒充关键人员变得轻而易举,甚至可以实现音频和视频伪装。如果客户服务或帮助台团队没有接受过针对这些新能力的培训,那么明确验证身份可能会变得极其困难。

总结

Mythos的网络安全能力是真实存在的。与之前的模型相比,其进展可能不像最初的公关宣传那样呈指数级增长,但改进无疑是显著的,尤其是在生成有效攻击代码方面。让我们保持冷静,利用Mythos暂时无法使用的这段时间重新调整,优先开展正确的项目。任何能降低漏洞被利用可能性的措施都值得采取:

  • 不要让攻击者独占大语言模型的优势,我们可以在很多方面利用人工智能进行防御,从事件响应支持到基于代理的安全审查。
  • 通过改进漏洞管理流程,特别是基于上下文的优先级排序和漏洞分类,缩短关键漏洞的修复时间。
  • 缩小攻击面,包括精简已部署的服务器镜像,以及通过零信任网络访问实施预身份验证来限制可访问性。
  • 在部署服务时坚持零信任思维:假设已被入侵、明确验证身份并遵循最小权限原则。
  • 在攻击路径上设置陷阱,让人工智能辅助的攻击者陷入其中,并向安全运营中心发出警报。大语言模型存在很多偏见,它们往往会反复使用相同的技术,而且行动方式非常直接,可以利用这一点为自己谋利!

Mythos并没有改变我们现有的网络安全优先级,但它让忽视这些优先级的代价变得更高。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值