大家读完觉得有帮助记得关注和点赞!!!

图1:将基于eBPF的内核遥测映射到MITRE ATT&CK的所提方法概述。
摘要
将观察到的系统行为映射到MITRE ATT&CK等标准化框架对于威胁知情防御至关重要,但这一过程在很大程度上仍是手工完成的。现有的自动化方法依赖于网络威胁情报(CTI)报告,而这些报告仅提供攻击的回顾性描述。低层遥测,即内核级系统调用,反而提供了对手行为的证据,但其体量和复杂性限制了其在自动映射中的应用。我们提出了一种方法,通过eBPF收集内核级事件,将攻击者命令关联到溯源图中,并导出适合基于LLM推理的紧凑图表示。这些表示使用纯LLM提示和基于ATT&CK知识库的检索增强生成(RAG)两种方式映射到MITRE ATT&CK框架,产生带有支持理由的排序技术候选。我们将该方法实现为端到端流水线,命名为Trace2ATT&CK,并使用本地部署的开源权重LLM在347个Linux Atomic Red Team测试上对其进行评估。RAG在ATT&CK映射性能上持续优于纯提示,而溯源图显著优于原始遥测。
允许为个人或课堂目的制作本作品全部或部分的数字或硬拷贝,无需付费,但不得制作或分发用于营利或商业优势的拷贝,且拷贝须在首页注明此声明及完整引用。本作品中由他人拥有的版权组成部分的版权须得到尊重。摘要中使用署名是允许的。如需以其他方式复制、再版、张贴于服务器或分发至列表,须事先获得特定许可和/或付费。请向 permissions@acm.org 申请许可。
这些结果表明,基于图的行为描述进行本地推理可以使从内核级遥测到ATT&CK的自动映射在操作上可行,同时不损害数据机密性。
CCS概念
• 安全与隐私 → 漏洞扫描器;• 计算方法学 → 人工智能;• 应用计算 → 证据收集、存储与分析。
关键词
低层遥测,攻击重建,溯源图,威胁情报,大语言模型
ACM引用格式
Matteo Lupinacci, Luigi Arena, Francesco Blefari, and Angelo Furfaro. 2026. A Graph-Based Approach for Mapping Kernel-Level Telemetry to MITRE ATT&CK. In . ACM, New York, NY, USA, 13 pages. https://doi.org/10.1145/nnnnnnn.nnnnnnn
1 引言
现代网络威胁日益复杂、具有规避性,并能快速适应现有防御。攻击者采用越来越复杂的战术、技术和程序(TTP),使安全团队难以及时检测和响应事件。在此背景下,MITRE ATT&CK框架[1]已成为分类和理解对手行为的标准,提供了在真实攻击中观察到的战术和技术的结构化知识库。有效应用ATT&CK需要一个基本步骤:将观察到的事件映射到适当的TTP。识别攻击者使用的具体技术可以实现更一致的威胁情报、事件告警方法,并简化事件响应。然而,由于真实系统中通常观察到大量安全事件,这种映射是一项劳动密集型且易出错的过程,难以扩展。
当前ATT&CK自动映射的领域主要集中于网络威胁情报(CTI)报告。研究人员和从业者已开发出使用自然语言处理和机器学习技术从非结构化CTI文档中提取战术和技术的方法[2, 3, 4]。这些方法通过自动化威胁报告分析推进了该领域,但存在一个关键局限:它们操作的是二手信息(即报告)。与此同时,系统上实际发生的事件(即应用程序日志、内核级系统调用、文件修改等)包含攻击者行为的证据。尽管这些低层事件是攻击现实展开的场所,但它们在自动ATT&CK映射中仍大部分未被利用。
据我们所知,将MITRE ATT&CK应用于原始或半结构化的主机级遥测在很大程度上仍是手工完成的。弥合这一差距绝非易事。系统日志体量巨大且结构复杂。单个系统每秒产生数千个事件;因此,从这些数据中提取有意义的知识本质上是困难的,因为这涉及识别哪些事件与攻击相关、理解各个操作之间的关联,以及从低层原语重建攻击者的操作序列。
为应对这些挑战,我们提出了一种将观察到的系统事件自动映射到MITRE ATT&CK战术和技术的方法,该方法:(1) 使用eBPF程序收集原始日志,以最小开销捕获系统调用和内核事件;(2) 使用基于图的关联方法重建攻击者的操作序列,将操作与其在系统上的后果关联起来,从而创建全面的溯源图;(3) 利用大语言模型(LLM)系统从生成的溯源图自动映射到ATT&CK TTP。
该方法提供了与基于CTI的方法不同的视角:不是分析他人对攻击者的报告,而是直接从系统本身观察和分类攻击者行为。所提方法使用Linux Atomic Red Team测试[5]进行验证。
我们围绕以下研究问题组织调查:
• RQ1:能否使用基于LLM的推理,通过重建的溯源图,直接从内核级系统遥测自动推断MITRE ATT&CK技术?
• RQ2:图表示的选择是否影响下游ATT&CK分类的质量?
本文的主要贡献如下:
• 我们提出了一种端到端方法,用于将内核级主机遥测映射到MITRE ATT&CK战术和技术,将映射过程直接建立在观察到的系统行为之上,而不是依赖事后的CTI报告或预标注的安全规则。
• 我们提出了Trace2ATT&CK,一个实现所提方法的端到端流水线。它结合了基于eBPF的遥测收集、攻击者会话锚定、溯源感知的攻击重建、命令-事件关联,以及用于下游LLM推理的原始和压缩加权命令图表示的提取。
• 我们发布了一个在执行Atomic Red Team场景时收集的内核级日志数据集,以促进该领域的未来研究。
2 背景与相关工作
2.1 低层遥测
在计算机安全背景下,遥测是指从被观察系统中自动持续收集操作数据,以实现实时监控、异常检测和事后取证分析[6]。低层遥测是该概念的细粒度变体,捕获源邻近信号,如数据包级、进程级、内核级和设备级事件,而不仅仅是聚合摘要。当遥测在内核级通过系统调用追踪、审计日志或溯源记录捕获时,它提供了对系统活动的特权视图,这从根本上比用户空间日志更难被对手规避或操纵[7, 8]。内核级遥测捕获进程执行、文件操作、网络连接和进程间通信等事件。在网络安全中,这种粒度至关重要,因为它提供了早期检测可疑行为、关联异构资产事件以及支持入侵后取证重建所需的可观测性[9, 10]。鉴于其在重建复杂攻击链方面的已证明有效性,内核级遥测构成了安全分析的可靠基础。
2.2 MITRE ATT&CK映射方法
从安全数据中自动识别MITRE ATT&CK技术是研究和工业应用日益关注的领域。这是因为它支持威胁狩猎、事件响应和检测能力覆盖评估等活动。
已开发出各种方法来解决这一问题,其中CTI报告的使用是主要信息来源。特别是,LLM最近被用于从非结构化信息中自动提取实体、关系和概念,促进知识图的构建和知识组织[11, 12]。这些模型超越了传统自然语言处理,支持在异构、嘈杂和语义模糊信息为特征的领域(如CTI)中表示和解释语义知识。
已开发出工具和框架来评估安全措施对MITRE ATT&CK框架的有效性。DeTT&CT框架[13]促进数据源和检测能力与ATT&CK技术的关联,而企业SIEM(安全信息和事件管理)平台,包括Splunk Enterprise Security [14]和Elastic Security [15],通过关联机制和预定义检测规则将观察到的安全事件链接到ATT&CK技术。虽然这些解决方案在操作环境中用于促进威胁检测和事件响应,但其有效性取决于相关信息源的可用性以及用于将安全事件与ATT&CK技术关联的预定义检测规则的覆盖范围[16]。因此,这些解决方案对识别尚未建模的新兴技术或攻击变体施加了限制。
2.3 相关工作
本工作位于基于溯源的攻击调查、自动ATT&CK映射和LLM辅助安全分析的交叉点。现有研究涉及这些方向,然而,较少有工作考虑从会话级运行时证据进行ATT&CK映射。
MGDA[17]学习结构和上下文表示来识别异常溯源实体,然后应用基于规则的匹配来重建面向TTP的场景。CTINexus [3]利用上下文学习从CTI报告中提取实体-关系三元组,解析语义等价实体,并推断缺失关系。为缓解CTI到ATT&CK分类的标注数据稀缺问题,SynthCTI [18]生成语义引导的合成样本,提高代表性不足技术的覆盖范围。同样,基于LLM的威胁狩猎框架集成语义推理、威胁情报和基于图的关联,以产生与ATT&CK框架一致的研究输出[19]。PROVCON[20]通过从报告中提取攻击原语、在网络靶场中重现活动,并从产生的遥测中导出溯源图,弥合了CTI和系统级证据之间的差距。因此,它依赖先验活动知识来生成代表性证据。我们的工作则从观察到的运行时活动出发,推断ATT&CK候选,而不需要特定活动的CTI描述来驱动执行。
最近的工作也将LLM应用于命令级ATT&CK分析。LADE[21]分析按时间排序的命令和脚本片段,以检测APT活动、定位恶意片段并排序相应的ATT&CK技术。它结合基于评分标准的提示、ATT&CK知识和摘要传播,以在长序列中保持上下文。与LADE不同——后者对记录的代码片段联合执行检测、定位和映射——Trace2ATT&CK假设预先划定的攻击区间,并从基于溯源重建的shell及后代进程执行中导出映射输入。这提供了来自内核级遥测的显式因果 relations,而不仅仅依赖按时间顺序的命令上下文。
表1:Trace2ATT&CK与代表性方法的比较。
| 方法 | 运行时遥测 | 溯源上下文 | 会话级分析 | LLM推理 | 排序技术 |
|---|---|---|---|---|---|
| MGDA[17] |
| ✓ |
|
|
|
| CTINexus [3] |
|
|
| ✓ |
|
| SynthCTI [18] |
|
|
| ✓ |
|
| LADE [21] | ✓ |
| ✓ | ✓ | ✓ |
| RAM[2] | ✓ |
|
| ✓ |
|
| Trace2ATT&CK | ✓ | ✓ | ✓ | ✓ | ✓ |
运行时遥测表示该方法操作执行轨迹而非CTI报告或分析师编写的规则。溯源上下文表示系统实体之间的显式因果依赖关系。会话级分析指对有界攻击者执行会话的推理。排序技术表示该方法返回按置信度排序的多个ATT&CK技术。
相关方法也将检测工件映射到ATT&CK。RAM[2]使用LLM流水线,结合SIEM规则描述、ATT&CK检索、候选生成和相关性过滤。SIEM和检测覆盖平台同样通过策划的规则和关联逻辑将遥测与ATT&CK关联。然而,这些规则编码了分析师定义的检测假设,而运行时事件只有通过其命令、进程和时间上下文才能获得意义。因此,映射溯源导出的执行流不同于映射规则文本或检测元数据。
3 问题陈述
给定与预先选定的恶意活动窗口相关的主机级事件结构化日志,本文解决如何自动为事件序列丰富MITRE ATT&CK技术和透明理由。通过关联这些事件,我们综合出一个统一的、人类可读的叙述,映射整个攻击生命周期的战术、技术和上下文。三个设计目标指导系统:
• 上下文敏感性。系统应认识到许多有意义的MITRE ATT&CK推断依赖于事件序列、因果关系和进程关系,而非孤立活动。
• 本地执行。完整流水线应使用本地模型、本地嵌入和本地向量存储运行,支持本地部署和隐私敏感用例。
• 可解释性和可解释性。系统不仅应预测技术,还应解释为什么证据支持这些技术。
我们关注攻击已知发生的预定义时间窗口,因此日志已包含相关事件序列。相应地,我们的目标不是异常检测,而是在已知攻击区间内的上下文可解释性、丰富和攻击行为重建。虽然异常检测可作为识别此类窗口的前置步骤,但超出了本文范围。在实践中,任何异常检测器或事件分诊机制都可服务于这一目的,但我们的方法假设攻击区间已被划定,因此专注于细粒度语义丰富。
激励性示例。 考虑SolarWinds供应链入侵[22],归因于APT29,在攻击者在受害者网络内停留约14个月后于2020年12月披露。该活动连锁了70多个MITRE ATT&CK技术。关键的是,ATT&CK映射是在初始入侵数月后通过手动关联FireEye、Microsoft和CrowdStrike的报告产生的;CISA仅在公开披露后才发布其技术表。与此同时,受害者组织已在日志中拥有原始遥测,如DNS信标、可疑的rundll32.exe调用和SAML令牌异常,但缺乏将这些信号提升为技术级告警所需的上下文映射。
此案例突出了CTI驱动映射流水线的一个关键局限:分类延迟。Mandiant和IBM X-Force报告[23]显示,高级威胁的中位驻留时间可达100至200天以上。我们的方法通过从事后情报转向直接从主机级遥测进行行为分类来解决这一差距。除了减少延迟,这种转变还可以支持快速结构化告警、检测规则生成和对手仿真。此外,通过为所提映射附加理由,输出可由SOAR平台消费、转换为Sigma规则,并用于紫队演练。
3.1 威胁模型
与先前研究[24, 25]类似,我们的工作考虑攻击者具有对目标系统的访问权限(本地或远程),并试图通过利用软件漏洞和连锁权限提升操作来维持持久存在。我们的可信计算基础包括底层系统内核和审计框架,以及离线分析流水线代码,这在现有工作中也是标准做法。
任何故意破坏安全审计系统的内核级攻击超出了本文范围。因此,我们假设使用现有的系统加固技术来缓解任何潜在的审计框架破坏。此外,我们不考虑硬件级或侧信道攻击,因为其行为通常不被内核级审计系统显式捕获。
4 方法
4.1 数据收集
我们利用扩展伯克利包过滤器(eBPF)[26]实现内核级遥测。eBPF是一种技术,能够直接在Linux内核中安全执行沙箱程序,无需内核修改或模块加载[27]。它已成为现代Linux系统的关键组件,被云提供商广泛采用以增强容器安全、网络管理和系统可观测性[28]。尽管eBPF最初为Linux系统开发,但其引入的优势已导致当前有项目旨在为Windows系统引入eBPF[29]。
与传统内核审计框架(如auditd)相比,eBPF为安全遥测提供了三个关键优势。首先,程序在执行前经过静态验证,确保它们不会崩溃或破坏内核,使eBPF成为比可加载内核模块更安全的替代方案[27, 30]。其次,eBPF程序可在运行时附加到广泛的内核钩子点——包括系统调用跟踪点、kprobes和perf事件——无需重新编译或重启,在选择监控事件方面提供了无与伦比的灵活性[28]。第三,由于eBPF程序在内核空间执行并通过即时编译为本地指令,它们可以在遥测数据到达用户空间之前过滤和聚合数据,显著降低与高容量事件收集相关的性能开销[27]。这些特性使eBPF特别适合作为网络安全中的低层遥测机制,结合了内核级观察的深度与安全性、灵活性和效率[28, 30]。
4.2 溯源图
虽然原始日志条目可能无法描绘复杂网络攻击的内在特征,但溯源图(PG)保留了系统实体之间的因果 relationships,使分析师能够追踪攻击入口点、识别多步攻击路径,并以高层语义重建攻击场景[31, 10]。基于溯源的表示为系统执行提供了整体的、攻击向量无关的视图,使其成为入侵检测的理想选择,因为它将进程、文件和网络套接字之间的交互捕获为统一的有向图,而非孤立事件[31]。这种基于图的方法已成为检测和调查高级持续性威胁(APT)的事实标准[32]。基于图的关联对于攻击重建特别有效,因为它揭示了系统行为之间的多层次隐藏关系——因果、上下文和间接——允许检测系统从大量审计日志中提取准确描述恶意活动的紧凑摘要图[10]。出于这些原因,我们使用PG作为攻击重建阶段的形式模型。
在此阶段,收集的内核级日志统一转换为PG,其中实体表示系统中的动态或持久对象,如进程、文件、套接字。它们可以对另一实体或自身执行操作,如进程创建、文件读/写或网络通信。基于这些交互,我们的方法构建有向PG,其中节点表示系统实体,边表示它们的交互。
让我们考虑以下系统实体集合:
• P 为进程集合,其中每个进程是由唯一实体标识符标识的执行上下文,具有进程名称和用户标识符等属性。
• C 为命令集合,其中每个命令表示与进程执行相关的操作。
• F 为文件集合,其中每个文件是由路径标识的文件系统对象。
此外,令 T = {s, x, r, w, d, c, a} 为事件类型集合,表示以下操作:派生(s)、执行(x)、读取(r)、写入(w)、删除(d)、连接(c)和接受(a)。对于每个事件类型 t ∈ T,我们定义因果关系 R_t 如下:
• R_s ⊆ P × P:一个进程创建另一个进程(建立父子关系)。
• R_c, R_a ⊆ P × P:一个进程与另一个进程建立或接受连接以交换数据。
• R_x ⊆ P × C:一个进程执行一个命令。
• R_r, R_w, R_d ⊆ P × F:一个进程访问文件以读取、修改或删除它。
定义4.1(溯源图)。 溯源图定义为有向图 G = (V, E),其中 V ⊆ P ∪ C ∪ F 是节点集合,E = ∪_{t∈T} R_t ∩ (V × V) 是边集合。根据定义,每条边对应两个系统实体之间的特定因果关系。
定义4.2(以进程为中心的社区)。 以主进程 p ∈ P 为根的以进程为中心的社区是由 G_p = (V_p, E_p) 导出的子图,其中 V_p 包含 p 以及从 p 通过 E 中的因果边可达的所有实体,E_p 包含 P 中实体之间的所有边。
我们引入以进程为中心的社区概念作为攻击重建的分析单元,遵循先前研究[24]。这一概念捕捉了以下观察:攻击期间的系统活动并非均匀分布在溯源图中,而是集中在少数驱动恶意执行的主进程周围。以进程为中心的社区以主进程为根,包含从其因果可达的所有实体——子进程、它们的命令以及相关事件——形成一个自包含的子图,代表对抗行为的连贯单元。
4.3 映射方法
一旦从内核级eBPF遥测重建了PG,方法的最后一步是将观察到的攻击流映射到MITRE ATT&CK技术和子技术。更详细地说,重建的PG被序列化为结构化文本表示,并馈送到LLM系统进行分类。
我们采用基于LLM的方法,因为这些模型在处理和推理结构化和半结构化文本数据方面已展示出最先进的性能,包括安全相关的图表示[33]。我们采用两种互补的LLM范式:纯LLM提示和RAG,以评估哪种配置最能利用ATT&CK知识库进行准确分类。RAG通过动态检索相关ATT&CK技术描述并将其作为事实上下文提供给LLM,已被证明可以在无需微调的情况下减少幻觉。
对于每个输入图,系统输出top-k候选分类的排序列表,其中每个候选包括ATT&CK技术标识符、相关战术、[0,1]范围内的置信度分数,以及证明映射合理的自然语言解释。包含解释有双重目的:增加分类的可解释性,并使人类分析师能够验证LLM的推理,这对于在安全运营中可信部署至关重要。
决定输出top-k候选技术的排序列表而非单一最佳匹配预测,是出于ATT&CK技术归因的固有模糊性。如先前在[21]中观察到的,不同技术在系统级别可能表现出高度相似的行为特征;例如,T1105(入口工具传输)和T1048(通过替代协议的外传)经常依赖类似的网络工具,使得单一预测方法在模型置信度分布在语义相关候选之间时容易产生假阴性。排序的top-k输出通过保留最合理的替代方案来缓解这一风险,支持下游评估指标,并为安全分析师提供更广泛的假设集以验证。
5 数据集
为进行评估,我们依赖Atomic Red Team [5],这是一个直接映射到MITRE ATT&CK框架[1]的开源对手仿真测试库。数据集组织为结构化仓库,每个测试——称为“原子测试”——驻留在以其对应ATT&CK技术标识符命名的专用目录中(例如,T1055表示进程注入)。每个技术目录包含一个规范YAML定义文件,指定测试元数据、支持的平台(Linux、macOS、Windows)、执行命令、可选先决条件、输入参数和清理命令。为以受控和可重现的方式执行原子测试,他们提供了Invoke-AtomicRedTeam [34],一个基于PowerShell的执行框架,自动调用atomics文件夹中定义的测试。Invoke-AtomicRedTeam允许按技术ID和测试编号选择特定测试(例如,Invoke-AtomicTest T1055-TestNumbers 1,2),运行给定技术的所有测试,或通过Invoke-AtomicTest All执行整个仓库。该框架还处理先决条件下载(-GetPrereqs)、测试后清理(-Cleanup)和日志记录,确保每次执行产生干净、隔离和可重现的遥测轨迹。每个原子测试对应特定的ATT&CK技术,提供预定义的标注方案,消除了手动标注的需要,并确保真值与学术界和工业界广泛认可的分类法一致[35]。
利用Invoke-AtomicRedTeam模块,用于执行测试的命令可能显式嵌入真值ATT&CK标识符。如果不加修改,这会使评估不公平,因为LLM可以直接从单个命令中恢复正确标签,而不是从重建的行为中。因此,我们在推理前清理命令行,用占位符令牌混淆所有ATT&CK技术和子技术标识符(例如,T1059 → TXXXX)。
最终数据集通过执行评估集中的所有攻击并通过Tracee作为eBPF程序收集日志获得,包含21,950,327行原始日志,总计29.8 GB。
6 Trace2ATT&CK设计与实现
本节详细介绍我们用于将内核级遥测自动映射到MITRE ATT&CK技术的端到端流水线Trace2ATT&CK的架构和实现。它按照所提方法开发。
我们假设一种威胁场景,攻击者具有对目标系统的远程访问权限,例如通过交互式SSH会话,并从远程shell发出命令。这些命令可能对应实际攻击序列,或对应内部触发恶意操作的高级脚本、包装器或实用程序。流水线通过四个阶段处理单个攻击场景:(1) 通过eBPF收集内核级遥测;(2) 在基于neo4j构建的图数据库中构建PG;(3) 使用自定义Cypher查询提取命令序列和图序列化;(4) 使用纯LLM提示或RAG进行基于LLM的ATT&CK分类。
6.1 遥测收集与预处理
Trace2ATT&CK依赖Tracee [36],一个基于eBPF的运行时监控工具,从目标系统收集内核级遥测。Tracee以最小性能开销捕获系统调用和内核事件,将其写为结构化JSONL记录,并丰富进程元数据(实体标识符、用户ID、时间戳和参数数组)。
原始Tracee输出由基于Rust的预处理器处理,执行三项操作:(1) 事件过滤,移除噪声条目(例如日期探针)并将每个事件投影到规范字段的固定模式(例如timestamp、userId、processId、parentProcessId、syscall、processName、args);(2) 分块,将事件流分割为每个10,000条记录的有序文件,以限制I/O成本;(3) 可选的TOON(面向令牌的对象表示法)序列化[37]。TOON是为LLM驱动工作流构建的格式,其中冗长等于成本。它旨在使结构化数据令牌高效,降低在语言模型中处理数据的成本。预处理器作为跨平台二进制文件分发(Linux x86_64/ARM64、macOS x86_64/ARM64),无需加载内核模块。
应注意,尽管我们依赖Tracee进行内核级日志收集,但此方法步骤可使用任何eBPF程序执行。这是通过从原始日志中提取上述特征集来实现的。
预处理后,分析的最终日志行数为21,823,051行,总计9.7 GB。平均而言,数据集中的每个攻击场景由超过62K行预处理内核级遥测描述。
6.2 溯源图构建
Trace2ATT&CK利用图数据库(具体为Neo4j)作为其主要数据结构,存储攻击溯源的结构化表示。负责数据库创建的模块分四个阶段协调摄取流水线。
1. 攻击者shell识别。 模块按时间顺序扫描预处理日志,定位非探针工件的已识别shell(例如bash、sh)的execve。遵循第3节中的假设,在预定义时间窗口内,我们确保找到攻击者shell,并通过遍历以识别的shell为根的进程谱系树来确定性地确定社区边界。
此步骤操作化了第4.2节引入的以进程为中心的社区概念:识别的shell作为主进程p,然后流水线的后续阶段——命令-事件关联和图摄取——通过收集从p因果可达的所有实体来构建导出子图G_p。
2. 命令-事件关联。 关键步骤是将攻击者发出的命令与其在系统上产生的后果关联起来。对于攻击重建,这很重要,因为单个命令生成多个事件,所有这些事件都对系统产生影响。为检索攻击者发出的命令,我们依赖基于shell日志记录的命令收集机制。此信息可通过shell历史文件如Bash的bash_history和Zsh的zsh_history、通过基于Red Hat的系统上的记账工具如psacct和基于Debian的系统上的acct,或通过自定义基于trap的记录器获得。
对于每个直接发出的命令,模块通过将命令时间戳与有界前瞻窗口内最近的execve出现及其参数匹配来识别相应的execve事件。为保持命令顺序并防止多对一匹配,每次成功关联后搜索位置单调推进。如果shell日志记录不可用或未能捕获命令,模块回退到从任何剩余的未匹配execve事件直接重建命令行,确保即使没有shell级日志记录,观察到的进程执行也不会被静默地从关联中丢弃。
然后,Trace2ATT&CK通过基于父子execve关系的广度优先遍历(BFS)重建完整后代进程树,并将重建的命令行及其完整本地事件流附加到每个发现的子进程。这产生因果结构化的执行切片,不仅捕获直接发出的命令,还捕获它在主机上触发的派生活动。
3. 图缩减。 关键设计决策涉及溯源图的粒度。我们应用针对MITRE ATT&CK映射任务定制的溯源图缩减策略,将节点集限制为Process和Command实体,有意排除文件级和网络级节点的数据库摄取。
此选择由映射任务本身的性质驱动:ATT&CK技术定义在对手程序(即系统上执行的具体操作)层面,这些操作主要由进程执行及其相关命令行参数捕获。文件路径、网络端点和其他系统对象随后嵌入命令参数中,因此可由LLM上下文推断,无需显式图节点。
这种选择性摄取优化了查询性能,并为LLM推理保持可处理的输入大小,同时在构建阶段保留完整的溯源信息以供其他分析任务潜在使用。此外,限制节点集直接解决了溯源分析中文献记载的依赖爆炸问题:大型完全展开的溯源图在大型语言模型的有限上下文窗口内不切实际,因为注入全面事件历史会产生 prohibitive 的令牌开销[38]。该领域的其他研究进一步支持这一设计:PROV-LLM [39]证明将大型溯源图分解为以进程为中心的子图——丰富进程名称、执行路径和命令行参数——比全图方法产生更优的检测准确率和精确率。关于此选择的更多证据见第7.2节。
4. 图摄取。 图摄取模块构建由entityID、processName、userId标识的Process节点和由cmdID、timestamp、cmdline标识的Command节点。节点之间的关系定义如下:
• SPAWNED:父到子进程关系;
• EXECUTES:进程直接执行命令;
• INDIRECT_EXECUTES:子进程命令执行;
• TRIGGERS:父命令到子命令的因果链接。
所有操作使用批处理Cypher查询(默认批大小1,000),使用MERGE进行幂等upsert,并对entityId和commandId设置唯一性约束。
6.3 命令图提取
Trace2ATT&CK的另一个关键设计选择是提取加权命令图,其中相同命令模式的重复执行被聚合,并通过与其执行频率成比例的权重表示。权重突出了ATT&CK映射的一个有用属性:不仅哪些命令出现重要,而且它们重复的频率也很重要。频率有助于区分孤立操作和更强的程序模式。Trace2ATT&CK导出两种加权表示。
完整加权命令图。 第一种表示保留攻击会话期间观察到的原始命令实例。每个EXECUTES边产生一个节点,包含执行进程(实体ID、名称、用户ID)、命令(完整命令行、时间戳)、其权限提升状态,以及通过TRIGGERS边检索的触发子命令列表。此外,每个命令节点标注同一命令行在会话中执行的次数,而重复的触发子命令被聚合并标记其相应的出现次数。
压缩加权命令图。 第二种表示通过规范化命令(即提取基本二进制文件和选项标志)减少冗余,并将相同的命令+选项模式合并为单一规范化视图。与原始版本一样,生成的图是加权的。这种压缩加权视图对于以重复行为为特征的攻击特别有用,例如迭代侦察或重复有效载荷调用。
两种表示都序列化为DOT图文件(通过pydot)。当完整DOT图超过15,000字符时,系统自动回退到压缩表示。提取的命令图的代表性示例见图2。
6.4 LLM提示
Trace2ATT&CK支持纯LLM提示和RAG作为分类范式,允许经验比较它们在从溯源图进行ATT&CK映射方面的有效性。
提示设计。 系统提示指示LLM充当网络威胁情报分析师,并输出按置信度排序的top-K候选技术的JSON数组(见附录C)。每个候选包括战术名称、技术和子技术(例如T1003.007,如果有)、(0,1)范围内的置信度分数,以及所提映射的自然语言理由。提示强制执行两个关键约束:(1) 只要攻击证据需要,就必须使用子技术;(2) 理由必须引用整个命令流,而非孤立命令。
检索增强生成。 RAG流水线将MITRE ATT&CK企业知识库[40]摄取到本地Chroma向量存储中。技术描述被分割为800词块,并使用mxbai-embed-large-v1 [41, 42]嵌入模型索引,该模型广泛用于AI中的语义搜索、聚类、分类和RAG。在推理时,DOT图被嵌入,并通过最大边际相关性(MMR)搜索(λ_MMR = 0.5,fetch_k = 20)检索top-5最相关的技术块。这些块作为事实上下文前置到用户提示中,将LLM的推理建立在官方ATT&CK分类法上,而无需将整个知识库放入上下文窗口。
6.5 实验设置
实验评估使用由Proxmox虚拟环境(Proxmox VE)9.1.7服务器上托管的两台虚拟机组成的基础设施进行,运行Linux内核6.17.13-2-pve,x86_64架构。物理服务器配备AMD EPYC™ Genoa 9554P处理器(64核/128线程,3.1GHz基础频率)和192GB RAM。
第一台虚拟机承载整个流水线执行环境,运行Ubuntu 24.04.4 LTS(Linux内核6.17.0-35-generic),配置16 vCPU(1插槽,16核)、16GB RAM、Docker 29.5.3和LXC 5.21.5 LTS。测试环境由四个主要组件组成:(1) 目标环境,代表被分析的系统(基于Ubuntu 24.04),可部署为Docker容器或LXC虚拟机。此环境配置了执行Atomic Red Team测试所需的工具,包括OpenSSH和PowerShell;(2) tracee容器,运行tracee v0.24.1,利用eBPF技术监控目标环境内执行的活动,收集日志并以JSON格式转发到fluentd;(3) fluentd容器,运行fluentd v1.19.3,负责管理tracee生成的日志,应用缓冲技术和日志轮转机制;(4) neo4j容器,运行neo4j v2026.05.0,用于存储和查询生成的溯源图。
第二台虚拟机专用于分析阶段使用的LLM的本地执行。它运行Ubuntu 24.04.4 LTS(Linux内核6.17.0-35-generic),配置16 vCPU(1插槽,16核)、32GB RAM、LM Studio 0.4.16(Build 2)、NVIDIA驱动595.71.05和CUDA 13.2。模型推理完全通过LM Studio本地执行,利用两块NVIDIA L40S GPU,每块48GB内存。

图2:为T1003.008(OS凭证转储:/etc/passwd和/etc/shadow)提取的加权命令图
表2:实验中评估的LLM。
| 模型 | 参数 | 量化 | 上下文窗口 |
|---|---|---|---|
| gpt-oss-20b [43] | 20B | GGUF MXFP4 | 32K |
| gpt-oss-120b [43] | 120B | GGUF MXFP4 | 32K |
| gemma-4-31b-it | 31B | GGUF Q4_K_S | 32K |
| llama-3.3-70b-instruct [44] | 70B | GGUF Q4_K_S | 32K |
| deepseek-r1-distill-qwen-32b | 32B | GGUF Q8_0 | 32K |
| foundation-sec-8b-reasoning [45] | 8B | GGUF Q8_0 | 32K |
| qwen3.5-9b [46] | 9B | GGUF Q8_0 | 32K |
7 结果与消融研究
我们使用表2中列出的七个本地LLM,在Atomic Red Team数据集的Linux特定测试子集上测试Trace2ATT&CK。本节报告的所有指标均在排除LLM输出不是格式良好的JSON对象的情况后剩余的N个有效映射上计算,我们将其视为不可解析预测。每个模型的无效输出更多细节见表5。
此外,由于部分测试在运行时因Atomic Red Team调用器仓库中缺少依赖项或执行攻击的用户缺少权限而失败,我们分别报告成功完成的测试(即测试返回状态码为0,N = 166)和失败的测试(N = 181)的指标。除了整个数据集上的技术识别结果外,我们还分别报告真值指定子技术的测试子集(N = 214)的结果,通过查找精确匹配(例如T1003.007)。我们报告多个基于排名的指标[21],以捕获正确性和位置质量。指标详见附录A。
7.1 定量结果
影响ATT&CK映射质量的关键因素是输入序列中包含的判别性行为证据的数量。在技术层面,较长的多步命令轨迹通常提供更丰富的因果上下文,使得更容易区分广泛的ATT&CK行为。相比之下,子技术分类本质上更加模糊,因为子技术捕获更广泛行为的更细粒度变体,因此需要更具体的上下文线索来区分可能兼容多个相关ATT&CK类的命令序列[47]。最近直接来自MITRE组织和威胁知情防御中心的工作[48]也强调,许多ATT&CK技术在孤立考虑时是模糊的,需要周围上下文来推断正确的对抗意图。
标签-标识符不一致。 在评估期间,我们观察到所有测试模型中反复出现的失败模式:模型正确识别了技术名称,但将其与错误的技术ID关联,或者相反,产生正确的ID但配以不匹配的技术名称。这种不一致的出现是因为模型依赖其参数知识将观察到的行为映射到技术名称及其对应标识符,但这种内部映射并不总是可靠的。为缓解此问题,我们引入了第三种分类范式,称为分类法接地提示。在此配置中,系统提示增加了技术ID到其规范名称的完整映射,直接从MITRE ATT&CK企业知识库[40]提取。注入的映射充当接地信号,将模型的预测锚定到官方分类法。
表3、4总结了本研究中考虑的三种配置的评估结果。对于配对比较,Δ表示分类法接地提示相对于基础LLM提示在HR@k上的绝对改进。HR@k衡量正确标签在LLM返回的top-k预测内的测试用例百分比(附录A)。我们设置K = 5。
LLM结果。 在基础LLM提示下,性能在不同模型间差异很大。值得注意的是,foundation-sec-8b-reasoning——一个在安全相关预训练数据上专门化的8B模型——大幅优于更大的通用模型如llama-3.3-70b-instruct(技术HR@5 = 49.2% vs. 35.26%,尽管参数劣势近9倍,仍有+13.94个百分点的差距)和deepseek-r1-distill-qwen-32b(49.2% vs. 29.97%),并与gpt-oss-20b具有竞争力。这表明领域专门化预训练可以成为ATT&CK映射质量的有效驱动因素。gpt-oss-120b总体仍是最强模型(技术HR@5 = 60.58%,子技术HR@5 = 33.33%),而deepseek-r1-distill-qwen-32b最弱。分类法接地提示在所有模型和设置中持续产生更高分数,同样是gpt-oss-120b优于其他模型。在精确子技术匹配层面,它达到HR@5 = 43.66%,是所有模型中最好的结果。在技术设置中,gpt-oss-120b达到最高HR@5(64.64%),紧随其后的是gemma-4-31-b(63.69%),而deepseek-r1-distill-qwen-32b再次记录最低分数。
RAG结果。 通过在推理时注入相关ATT&CK知识,模型可以将观察到的行为与更窄且更好接地的候选技术集进行比较,减少语义模糊性并改善细粒度子技术归因。这一效果反映在我们的结果中:在精确子技术匹配层面,gpt-oss-20b的HR@5相对于基础提示几乎翻倍(16.11% → 31.55%,+95.85%相对增益)。总体而言,gpt-oss-120b在子技术层面达到最高HR@5(46.26%),而在技术设置中它在所有配置中达到最强总体结果(HR@5 = 66.57%),其次是gemma-4-31-b(HR@5 = 65.42%),而deepseek-r1-distill-qwen-32b仍然是最弱表现者。
比较。 将基础LLM提示与RAG直接比较,HR@5在所有模型-标准组合中持续改善(14/14),这比仅分类法接地提示观察到的趋势更强且更一致。在技术层面,HR@5增益范围从+1.78(foundation-sec-8b-reasoning)到+10.66(gemma-4-31b-it),平均改进约5.52个百分点。在精确子技术层面,增益更大且变化更多,范围从+0.93(gemma-4-31b-it)到+15.44(gpt-oss-20b),平均约8.03个百分点,确认检索接地上下文对区分细粒度行为变体特别有益。值得注意的是,最大的技术级增益和最大的子技术级增益出现在不同的中等规模模型上,表明RAG的益处并非严格与模型规模相关,而是与给定模型的参数知识对ATT&CK分类法的覆盖程度有关。
成功 vs. 失败攻击。 一个重要实际问题是,当底层攻击未完全执行时,Trace2ATT&CK是否仍然有用——这在真实部署中是常见场景,对抗行动经常在完成前被防御、错误配置或缺少先决条件中断。
在技术层面,失败攻击的性能与成功攻击接近,在某些情况下甚至超过。例如,在基础提示下,foundation-sec-8b在成功攻击上达到HR@5 = 49.67%,而在失败攻击上为48.75%。总体而言,结果表明ATT&CK技术背后的粗粒度对抗意图通常已可从攻击被中断前产生的部分命令流中读取,而不需要完整攻击链展开。
在精确子技术层面,情况发生变化:成功和失败攻击之间的差距大幅扩大,并且始终有利于成功攻击,对于gemma-4-31b-it超过21个百分点,在RAG下,对于gpt-oss-120b超过29个百分点(成功攻击HR@5 = 60.36% vs. 失败攻击31.07%)。这与上述子技术分类的更细粒度性质一致:区分密切相关的行为变体需要更完整的上下文证据,而中断的执行按定义无法完全提供。
综合来看,这些结果表明Trace2ATT&CK在技术级分诊和告警方面保留了大部分价值——这可以说是SOC分析师应对进行中或受阻入侵尝试时更具可操作性的输出——而其更细粒度的子技术归因能力如预期更依赖于观察完整的对抗程序。
讨论。 尽管我们的主要目标是支持使用较小模型的有效本地推理,但我们还包括了前沿模型Claude-Sonnet-5的实验以验证方法本身。其基本理由是,高度 capable 模型的强性能表明所提流水线是合理的;使用较小本地模型观察到的任何性能下降因此主要可归因于有限的模型能力,而非方法缺陷。
结果支持这一解释。Sonnet-5在所有设置中达到高性能,在技术层面达到HR@5为90.91%,在精确子技术层面为74.76%,与最佳本地模型结果(gpt-oss-120b)相比,分别高出+24.34%和+28.5%。这证实当有足够的模型能力时,所提流水线能很好地处理该任务。此外,添加RAG对Sonnet-5没有产生有意义的改进,表明该模型已在内部编码了足够的相关ATT&CK知识。这种行为与较小模型形成对比,后者的RAG产生明显增益,表明检索主要补偿较弱的参数知识。总体而言,这些结果表明观察到的性能差距主要由模型强度驱动,同时也验证了所提方法的方法学合理性。
所有这些结果和考虑使我们能够肯定地回答第一个RQ:通过基于LLM的推理在重建的溯源图上,可以可靠地从内核级遥测推断MITRE ATT&CK技术。前沿模型验证进一步确认了整体流水线的合理性,表明本地模型观察到的差距源于模型能力而非方法学局限。
与LADE的比较。 在先前工作中,LADE [21]与我们的方法最接近,因为它同样将基于LLM的推理直接应用于命令级证据而非CTI报告。然而,LADE的评估规模要小得多且不太现实:仅35个攻击序列,每个平均约990个代码片段,每个片段仅4.8个非空行(每个约4.7K行日志)。相比之下,我们的评估涵盖347个Linux Atomic Red Team测试用例,每个源自完整的内核级遥测轨迹,平均每个场景约62K行原始eBPF事件——每个场景比LADE的片段序列大三个数量级以上。这使我们的评估设置更接近现实操作部署。
7.2 消融研究
我们进行了两次消融以量化Trace2ATT&CK中图构建阶段的贡献。消融研究仅在分类法接地提示下的gpt-oss-120b上进行,这是主实验中确定的最佳表现LLM。
表格3: 各LLM的映射性能对比:基础提示词 vs. 基于分类体系的提示词
| 模型 | 层级 | 基础提示词 |
|
|
| 基于分类体系的提示词 |
|
|
| ΔHR@5(%) | |
|---|---|---|---|---|---|---|---|---|---|---|---|
|
|
| 全部 | 成功 | 失败 |
| 全部 | 成功 | 失败 |
|
| |
|
|
| HR@5 | HR@5 | MRR@5 | NDCG@5 | HR@5 | MRR@5 | NDCG@5 | HR@5 | MRR@5 | NDCG@5 |
| foundation-sec-8b-reasoning | 技术 | 49.20 | 49.67 | 0.342 | 0.381 | 48.75 | 0.332 | 0.371 | 56.27 | 55.63 | 0.368 |
|
| 子技术 | 27.78 | 30.10 | 0.203 | 0.227 | 25.26 | 0.176 | 0.195 | 34.34 | 36.89 | 0.253 |
| qwen3.5-9b | 技术 | 43.01 | 48.09 | 0.350 | 0.382 | 38.71 | 0.298 | 0.321 | 51.40 | 55.73 | 0.400 |
|
| 子技术 | 13.97 | 18.09 | 0.136 | 0.147 | 9.41 | 0.075 | 0.080 | 22.91 | 30.85 | 0.222 |
| gpt-oss-20b | 技术 | 43.79 | 42.59 | 0.305 | 0.335 | 44.89 | 0.338 | 0.366 | 46.75 | 44.44 | 0.318 |
|
| 子技术 | 16.11 | 19.27 | 0.134 | 0.149 | 12.75 | 0.102 | 0.108 | 25.59 | 26.61 | 0.197 |
| gemma4-31b-it | 技术 | 54.76 | 62.05 | 0.510 | 0.538 | 48.07 | 0.390 | 0.412 | 63.69 | 68.07 | 0.562 |
|
| 子技术 | 31.31 | 41.44 | 0.335 | 0.355 | 20.39 | 0.183 | 0.188 | 36.45 | 46.85 | 0.382 |
| deepseek-r1 distill-qwen-32b | 技术 | 29.97 | 35.54 | 0.250 | 0.277 | 24.86 | 0.191 | 0.206 | 38.04 | 40.96 | 0.292 |
|
| 子技术 | 4.21 | 7.21 | 0.053 | 0.058 | 0.97 | 0.005 | 0.006 | 9.35 | 10.81 | 0.081 |
| llama-3.3-70b-instruct | 技术 | 35.26 | 41.21 | 0.286 | 0.317 | 29.83 | 0.175 | 0.205 | 40.46 | 44.85 | 0.327 |
|
| 子技术 | 13.55 | 18.92 | 0.129 | 0.144 | 7.77 | 0.053 | 0.059 | 21.96 | 24.32 | 0.151 |
| gpt-oss-120b | 技术 | 60.58 | 59.64 | 0.486 | 0.513 | 61.45 | 0.482 | 0.515 | 64.64 | 63.25 | 0.504 |
|
| 子技术 | 33.33 | 40.54 | 0.344 | 0.360 | 25.49 | 0.195 | 0.210 | 43.66 | 54.05 | 0.445 |
表格4: 结合RAG的各LLM映射性能
| 模型 | 层级 | 全部攻击 | 成功攻击 | 失败攻击 | ||||
|---|---|---|---|---|---|---|---|---|
|
|
| HR@5(%) | HR@5(%) | MRR@5 | NDCG@5 | HR@5(%) | MRR@5 | NDCG@5 |
| foundation-sec-8b-reasoning | 技术 | 50.98 | 52.38 | 0.370 | 0.408 | 49.69 | 0.333 | 0.374 |
|
| 子技术 | 34.72 | 36.63 | 0.290 | 0.309 | 32.61 | 0.246 | 0.266 |
| qwen3.5-9b | 技术 | 50.00 | 55.86 | 0.434 | 0.465 | 44.97 | 0.322 | 0.353 |
|
| 子技术 | 22.68 | 28.28 | 0.210 | 0.228 | 16.84 | 0.120 | 0.132 |
| gpt-oss-20b | 技术 | 46.61 | 46.58 | 0.367 | 0.392 | 46.63 | 0.367 | 0.392 |
|
| 子技术 | 31.55 | 36.79 | 0.299 | 0.316 | 26.00 | 0.218 | 0.229 |
| gemma-4-31b-it | 技术 | 65.42 | 68.67 | 0.550 | 0.585 | 62.43 | 0.488 | 0.522 |
|
| 子技术 | 32.24 | 40.54 | 0.312 | 0.336 | 23.30 | 0.179 | 0.193 |
| deepseek-r1 distill-qwen-32b | 技术 | 37.18 | 37.95 | 0.269 | 0.297 | 36.46 | 0.269 | 0.293 |
|
| 子技术 | 12.15 | 16.22 | 0.129 | 0.137 | 7.77 | 0.045 | 0.054 |
| llama-3.3 70b-instruct | 技术 | 38.44 | 42.42 | 0.314 | 0.341 | 34.81 | 0.193 | 0.231 |
|
| 子技术 | 16.90 | 20.00 | 0.137 | 0.152 | 13.59 | 0.073 | 0.088 |
| gpt-oss-120b | 技术 | 66.57 | 64.46 | 0.505 | 0.540 | 68.51 | 0.515 | 0.558 |
|
| 子技术 | 46.26 | 60.36 | 0.489 | 0.518 | 31.07 | 0.267 | 0.278 |
原始日志 vs. 基于图的表示。 我们评估第4节引入的图构建步骤是否实际必要,或者LLM在给定原始按时间顺序排列的内核级事件流时能否表现相当。直接用原始日志提示LLM导致排序质量相对于基于图的表示明显下降。原始eBPF输出每单位信息明显更冗长,因为它在许多冗余事件中重复进程/用户元数据和低层系统调用参数;这膨胀了提示,对于较长的攻击序列,有超过模型有效上下文窗口或强制截断的风险,直接损害相关行为的召回。其次,更重要的是,原始日志没有使事件之间的因果关系显式化——LLM必须自己推断哪个进程派生了哪个命令,以及一系列系统调用如何组成连贯的对抗程序。
原始日志在子技术层面(精确匹配)达到19.57% HR@5、0.214 MRR@5和0.227 NDCG@5,53.1%的情况下为空输出,而在技术层面原始日志达到37.88% HR@5、0.298 MRR@5和0.385 NDCG@5,56.73%的情况下因超过令牌限制而为空输出。这证实非结构化遥测难以可靠地映射到ATT&CK技术,更重要的是,原始日志基线在输入接近本地推理设置的上下文限制时可能失败。
完整溯源图 vs. 命令图。 我们在固定32K令牌上下文预算下,将完整PG与主实验中使用的缩减命令图进行比较。所提完整PG关联在精确匹配的子技术层面达到46.81% HR@5,而在技术层面,当映射未达到上下文窗口限制时达到69.27% HR@5。尽管完整PG只要在上下文窗口内就能达到更高的原始HR@5,但其实际不可靠性削弱了这一优势:近一半输入产生空输出(技术层面高达49.76%,子技术层面45.93%),完整PG实际上对大约一半的测试用例未能返回任何映射。在操作环境中,稍微不太准确但始终可用的技术级预测远比稍微更好但一半时间缺失的预测有价值。相比之下,紧凑命令图表示从未超过上下文预算,因此始终产生可用的候选列表,使其在有界本地推理资源下成为更实用的选择,即使以每个案例准确率适度下降为代价。
我们现在可以回答RQ2:命令图表示的选择对分类质量有实质性影响。原始非结构化遥测表现明显更差(子技术HR@5 = 19.57% / 技术37.88%),并且由于上下文窗口截断而频繁产生空输出。完整溯源图比原始日志提高准确性,但仍令牌繁重,导致高达49.76%的情况下为空输出;我们主实验中使用的紧凑加权命令图表示完全避免了这种失败模式(0.0%空输出)。
8 结论
本文提出了一种方法和端到端流水线,用于自动将内核级遥测映射到MITRE ATT&CK技术和子技术。通过eBPF收集系统调用、将攻击者相关进程树重建为溯源图,并导出紧凑加权命令图表示,我们的方法弥合了低层主机证据和高层威胁知情分类之间的差距。我们在三种分类范式(基础提示、分类法接地提示和RAG)下,使用七个本地部署的LLM对Atomic Red Team场景评估了该方法。
RAG在映射准确性上持续优于基础提示(高达+15.44 HR@5点),尤其是对较小模型,而安全专门化的8B模型可与大得多的通用模型匹敌,表明领域预训练可能比规模更重要。系统在不完整攻击上也能优雅降级,即使执行中断也能保持技术级准确性。我们的消融证实紧凑命令图是可靠本地推理的关键:完整溯源图更准确,但由于上下文限制,近一半情况下不返回输出。最后,使用Claude-Sonnet-5(HR@5 = 90.91%)的验证确认了流水线的合理性,表明本地模型差距源于能力而非方法学。

1107

被折叠的 条评论
为什么被折叠?



