登顶顶会 | BlockSec 与浙江大学联合论文入选 FSE 2026:AI 审计,离真实安全研究更近了一步

BlockSec 与浙江大学联合完成的研究论文 《Thought is All You Need: Smart Contract Vulnerability Detection with Thought-Augmented Large Language Model》 已被软件工程顶级会议 FSE 2026 收录。

FSE(ACM International Conference on the Foundations of Software Engineering)是软件工程领域的顶级会议之一,本届会议将于 2026 年 7 月 5 日至 9 日 在加拿大蒙特利尔举行。

现有 AI 审计卡在哪里

先看一组论文中引用的已有研究数据,当前 AI 审计大致处于以下水平:

  • GPT-4Claude-1.3 做漏洞检测时,误报率曾高达 95%。也就是说,报出 100 个"漏洞",95 个是假的。

  • GPTScan 把 GPT 与静态分析结合,在大规模项目中的检测准确率约 57%

  • 一些号称用上了"漏洞知识库"的 RAG 方法,即便只做漏洞类型识别这种相对简单的任务,准确率也只有约 30%

  • 直接使用 GPT-4o、o3-mini、Claude 等最新模型做零样本检测,F1 分数仅在 0.241 至 0.311 之间。

这些结果放在一起,已经可以看出目前AI审计的主要问题。大模型当然有价值,但很多方案的做法仍然停留在同一个层面:把整份合约放进上下文里,让模型自行判断哪里可能有问题。

但真实审计并不是这样开展的。经验丰富的研究员通常不会平均扫描所有代码,而是会先判断哪些位置值得重点分析,再围绕关键函数、状态变量和业务流程向下展开。过去的 AI 审计,真正缺少的就是这套工作方式。

围绕这个问题,论文提出了 Synapse。它是一套面向智能合约漏洞检测的系统,目标是把安全研究员在真实审计中的关键步骤拆出来,交给系统分阶段完成。简单来说,Synapse 想让 AI 更接近安全研究真正的工作流程,而不只是再试一次让大模型读代码。

这也是 Synapse 试图解决的问题。在同样的测试条件下,Synapse 的 recall(真实漏洞找回率)达到 71.9%76.5%,约为已有 LLM 路线的 3 倍。进一步放到 BSC 链上的真实合约中测试,Synapse 发现了 117 个未知漏洞,而对照的 baseline 工具只识别出其中 8 个。其中一个关键漏洞,涉及约 3000 万美元的潜在资产损失。

把真实的工作方式拆解成流程

Synapse 的核心,是尽可能的把安全研究员在真实审计中的工作方式,拆解成一套系统能够执行的流程。

一、把真正值得看的地方找出来

真实的智能合约动辄几千行代码,但针对特定漏洞,真正需要看的可能只有几十行。Synapse 引入 Focal Context(焦点上下文),先定位高风险区域,再让模型集中分析。

这与真实审计的阅读方式是一致的。研究员分析代码时,通常会先关注关键函数、状态变量和核心业务逻辑。Synapse 只是把这一步前置了。实验结果显示,一旦去掉这个组件,recall(真实漏洞找回率)就会从 72.5% 下降到 52.8%。

二、把审计经验转成可复用的判断框架

Synapse 从 14,000+ 份真实审计报告中提炼出漏洞推理模板,形成 Thought Buffer(思维缓冲区)。它是一套结构化知识:遇到这种代码模式时,应该从哪几个角度分析风险。

例如面对一个提币函数,系统不会只做泛化阅读,而是会更有针对性地检查权限控制是否充分、重入保护是否完备、余额计算是否存在风险。这个过程依赖的是长期审计经验的沉淀,远超一次性的 prompt 技巧。

这一部分拿掉以后,recall(真实漏洞找回率)会从 72.5% 下降到 46.2%,影响非常明显。

三、通过分工协作把结论做实

Synapse 设计了 Developer(开发者)、Researcher(研究者)、Auditor(审计员)、Verifier (验证员)等多个角色,配合语义搜索、代码分析等工具完成检测。

这里真正重要的是分工本身。理解代码、提出漏洞假设、交叉复核、确认结论,在真实审计里本来就是不同性质的工作。很多时候,难点并不在于发现线索,而在于确认这条线索是否成立。Verifier 角色的价值就在这里。

如果拿掉语义工具这一层,recall(真实漏洞找回率)会下降到 43.6%。这也说明,Synapse 的提升来自几个关键部分共同作用。

基准测试

Synapse 与现有工具主结果对比

在两个真实世界数据集上:

  • Incidents 数据集:Synapse recall(真实漏洞找回率)71.9%,F1 73.1%;GPTScan 仅 10.8%

  • DeFiHacks 数据集:Synapse recall(真实漏洞找回率)76.5%,F1 63.4%

与传统静态分析(Slither)、模糊测试工具(ItyFuzz)相比,平均也有大约 2 倍的提升。

消融实验

关键组件消融实验(采用当时最新模型)

消融实验最能说明问题。直接使用 GPT-4o、o3-miniClaude 做零样本检测,F1 基本都在 0.3 左右;加入 Synapse 的完整流程后,系统 F1 提升到 0.723

链上实测

2025 年 2 到 3 月,在 BSC 链上测试 Synapse:

  • 发现 117 个此前未被发现的漏洞,全部为 High 级别。

  • 对照组 baseline 工具仅识别出其中 8 个

  • 其中一个关键漏洞涉及 约 3000 万美元 的潜在资产损失。

这对审计意味着什么

Synapse 的Thought Buffer(思维缓冲区)来自 14,000 多份真实审计报告的蒸馏,Focal Context(焦点上下文) 的设计依赖对合约安全分析流程的深入理解,多角色架构的划分映射的也是真实审计工作中的方法拆解。这些都不是纯粹的学术构造,而是长期积累的安全经验和工具链能力在研究层面的系统化表达。

换个角度说,这篇论文也证明了一件事:来自产业一线的安全理解,可以被组织成经得起顶级学术会议评审的方法论。模型 API 谁都能调,但把真实世界的审计经验转化成结构化、可验证、可复现的系统,门槛要高得多。

围绕 Synapse 形成的检测思路、工具能力和工作流设计,可以用来提升真实项目中的审计覆盖、问题筛查效率和复杂逻辑漏洞的发现能力。

人仍然不可替代

71.9% 的 recall(真实漏洞找回率)和 117 个真实漏洞是很强的结果,但在安全领域,71.9%还远远谈不上万无一失,安全需要的是100%,只要误判一次、漏判一次,代价都可能非常高。

LLM 仍然存在 hallucination 问题,在事实一致性和推理忠实性上有天然风险。Synapse 更擅长的是依赖语义理解的复杂逻辑漏洞,并不能替代传统工具处理所有 machine-auditable bugs。

真实的安全审计远不止模式识别。理解协议设计中的隐含假设,判断攻击者最可能走哪条路径,在不完整信息下排列风险优先级,在多个看起来都有问题的发现中决定哪些值得上报。这些判断,今天仍然只能由人来完成。

AI审计的方向是 human-in-the-loop:AI 负责更广的覆盖面、更快的初筛和更低的边际成本;人负责最终的判断、复核与决策。Synapse 把 AI 能做到的事情往前推了一大步,也让 AI 安全审计这条路上的方法论轮廓变得更清晰。

论文作者:

彭超源 (浙江大学)

姜木慧 (BlockSec)

周亚金 (BlockSec)

吴磊 (浙江大学 & BlockSec)

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值