面向零样本威胁分类的语义元对齐

面向零样本威胁分类的语义元对齐 大家读完觉得有帮助记得关注和点赞摘要网络安全系统必须快速适应新兴威胁。然而当新威胁首次出现时其类别的标注数据尚不可用。广义零样本学习GZSL提供了一种自然的解决方案它通过辅助语义知识而非标注样本来识别未见类。大语言模型LLM在此场景中尤为有前景因为它们能将非结构化的网络威胁情报CTI报告转换为新兴威胁的语义原型。然而将语言驱动的零样本学习应用于网络安全存在诸多困难威胁描述之间语义重叠强烈、行为属性与文本之间存在异质性、严重的类别不平衡以及训练期间未见威胁未知的开放集条件。我们提出 SMETA-ZSL它通过对比微调从重叠的语言描述中学习语义原型通过情景元学习和知识蒸馏对齐行为特征并执行自适应路由以实现已见类与未见类上的泛化。在7个基准数据集上SMETA-ZSL在最严格的归纳设置下取得了最优的整体广义零样本性能平均超越先前方法10.8个百分点最高提升达18.1个百分点。代码仓库GitHub - Security-And-Intelligence-Lab-UTEP/SMETA-ZSL · GitHub1 引言网络防御系统依赖大量原始数据如恶意软件样本或日志来训练和更新模型然而这些数据通常难以获取、分析缓慢并且在新威胁出现时并非总是可用。以恶意软件分类任务为例新变种和家族的持续涌现Tang等2023需要频繁重训练分类器带来显著的计算开销Li等2024a并使获取及时标注数据以适配新威胁变得困难Barros等2022Aurna等2025。相比之下网络威胁情报CTI报告由分析人员定期发布提供关于攻击者行为的及时自然语言描述。然而大多数防御系统并不处理自然语言因此无法直接使用CTI来调整或更新其行为导致宝贵的威胁情报未被充分利用。大语言模型LLM提供了一种处理CTI并提取可供下游系统使用信息的方法。先前工作Chakraborty等2026Mitra等2025Bertiger等2025Schwartz等2025主要集中在使用LLM生成基于规则的防御。相比之下利用CTI更新数据驱动的黑盒机器学习系统要困难得多因为这需要将文本描述转换为能够影响模型行为的信号而无需访问原始数据。这一差距引出一个重要的语言建模问题语言模型能否将非结构化的威胁报告转换为对更新非语言机器学习系统有用的表示即使在新威胁没有任何标注样本的情况下直接使用LLM进行零样本恶意软件或攻击检测具有挑战性因为网络安全工件通常规模过大无法完整分析使得推理成本高昂且经常超出实际上下文窗口限制Qian等2025。将这些工件截断为抽象特征会降低性能Zhou等2024。相反我们的目标是通过语言模型从CTI中提取并迁移知识以调整现有的网络防御系统。我们将此问题形式化为广义零样本学习GZSL设置其中下游机器学习模型必须同时识别已见类和未见类网络威胁情报CTI为未见威胁提供语义信息。虽然带有语义辅助信息的GZSL在广义场景如视觉-语言领域中已被广泛探索Chen等2023Ma和Hu2020Rao等2024Lei等2024但其在网络安全中的应用仍然是一个开放且基本未解决的挑战尽管具有重要的实际意义。该设置中的独特挑战如下。类别原型的语义模糊性与具有可区分语义特征的广义领域不同网络安全依赖的CTI报告在不同恶意软件家族之间的描述经常高度重叠。不同家族频繁共享API、行为模式和攻击技术使得语义原型弱可分并降低了向未见类的迁移能力。图1展示了这一挑战。跨模态异质性恶意软件特征来自行为观察如API调用、系统跟踪和网络流量。这些特征与CTI报告的稀疏、高层语义有显著差异使得特征空间与语义空间之间的对齐变得困难。类别不平衡已见类主导性在GZSL中已是一大挑战。在网络安全中这一问题被严重不平衡放大良性样本占主导新兴恶意软件家族稀少导致预测偏向常见已见类。开放集分类在实践中训练期间未见恶意软件家族的数量和身份都是未知的。因此模型必须在不预先假定固定未见类候选集合的情况下区分已见和未见威胁。我们提出 SMETA-ZSL一个基于语义的元GZSL框架专为现实的网络威胁场景设计其中未见类在训练期间未预先定义未见类的无标注实例不可用适应必须仅依赖自然语言CTI报告而非原始工件。与假设封闭集合、可访问原始未见类数据或预定义未见原型的前期方法不同SMETA-ZSL在更严格的开放集、类归纳、实例归纳设置下运作。为解决由此产生的挑战我们的框架结合了(1) 经对比微调的LLM编码器可从重叠的CTI描述中生成有判别力的语义原型(2) 跨模态对齐框架使用情景元学习在训练期间显式模拟未见类的出现(3) 用于自适应推理的无参数门控机制。在7个基准数据集上SMETA-ZSL在最严格的归纳设置下取得了最优的整体广义零样本性能。图1两个不同恶意软件家族Mobidash 和 Dowgin的CTI报告在行为描述上具有大量词汇重叠说明网络安全类原型在语义空间中弱可分。2 相关工作零样本学习ZSL解决的是识别训练期间从未见过的类别的实例的问题Pourpanah等2022Wang等2019。在GZSL中分类器必须同时覆盖已见类和未见类的并集Li等2024bVerma等2020且已见类主导性加剧了难度——推理时已见类的后验概率系统性地压倒未见类Kwon和Al Regib2022Bhat等2025Xian等2017。由于训练期间从未见过未见类ZSL方法依赖辅助语义信息来弥合鸿沟。受人类认知启发——人类通过背景知识将陌生概念与熟悉概念联系起来Fu等2015Romera-Paredes和Torr2015Tang等2024Li等2024bSanchez等2025现有方法大致分为三类学习模态与语义表示之间的联合嵌入空间Ali和Khan2023Nawaz等2022Chen等2023Lei等2024从语义描述中合成生成未见类数据Mishra等2018Ma和Hu2020Tang等2024Wu和Bergman2025bMarszałek等以及学习语义原型Wang等2025aFu等2017Wang等2021Rao等2024Fan等2026Gill等2026。其中语义原型方法特别适合那些类别级描述可用但未见类实例级数据缺失的设置。ZSL也被适应到领域特定场景包括网络安全其中专门框架解决了数据稀缺下的恶意软件检测Barros等2022Wang等2025bAurna等2025。3 方法我们提出SMETA-ZSL一种面向表格数据分类的基于语义的GZSL框架。我们的核心假设是大语言模型在适当微调后可以作为重叠自然语言描述与细粒度行为属性之间的可靠语义桥梁通过明确对齐异构模态的情景元训练实现未见类的零样本识别。图2给出了我们提出框架的概览。图2我们提出的SMETA-ZSL框架概览当语义描述存在重叠且处于更高抽象层次时利用语义原型进行GZSL。3.1 预备知识在零样本学习中存在两个不相交的类别集合已见类 S有标注训练实例可用和未见类 U训练时没有标注实例。具体在GZSL中分类器 f(·): X → S∪U 必须同时覆盖已见类和未见类的并集。每个类别 c∈S∪U 由一个原型向量 t∈T⊆ℝᴹ 表示通过原型函数 π(·): S∪U → T 编码。由此得到已见类和未见类的原型集合 Tₛ {tⁱₛ} (i1..Nₛ) 和 Tᵤ {tⁱᵤ} (i1..Nᵤ)作为知识从 S 迁移到 U 的语义桥梁。给定测试实例 xⁱ投影网络 f_θ: X→T 将其映射到共享语义空间预测类别由最近邻原型匹配确定网络安全设置引入了超出标准GZSL的两个额外结构约束。第一我们在开放集假设下运作与封闭集GZSLS∪U完全预定义不同训练时仅已知 S。未见类 U包括其基数 |U|Nᵤ 和身份 {cⁱᵤ}仅在推理时揭示反映了现实世界中无法预先预见新型恶意软件家族的情景。第二我们采用类归纳、实例归纳CIII设置Pourpanah等2022即模型仅使用 D_train 和 Tₛ 进行训练训练期间不访问 Tᵤ。未见原型仅在推理时可用作为模型泛化到新未见类的语义桥梁。在网络安全领域该桥梁由网络威胁情报CTI报告构建——由专家撰写的非结构化文档描述每个威胁类的行为特征、战术和技术。我们的目标是确保知识从 S 可靠地迁移到 U尽管这些报告引入了语义重叠和跨模态异质性这正是SMETA-ZSL直接应对的挑战。3.2 使用LLM的判别性语义原型学习用于语义原型构建的LLMLLM是语义原型构建的自然选择给定类别的自然语言描述预训练编码器可将文本映射为捕获其语义内容的稠密向量。这些向量作为 T 中的类原型提供每个类别的表示。然而直接用预训练语言模型编码CTI报告会产生弱可分的原型因为不同类别的威胁描述经常共享结构性词汇和领域特定术语导致它们的嵌入聚集在共享质心周围而非反映类别判别结构。监督对比目标令 zⁱ∈ℝᴹ 表示语言模型产生的描述样本 i 的L2归一化嵌入。为了在语言模型的表示空间中强化类内紧凑性和类间分离性我们使用监督对比损失Khosla等2020进行优化该损失将同类描述拉近同时将不同类描述推远其中 P(i) 是与 i 共享相同类别标签的正样本集合A(i) 是批次中所有其他描述样本的集合τ 为温度超参数。图3展示了对比微调对学习到的语义空间几何结构的影响。各向同性正则化仅优化 ℒ_SupCon 在类别描述共享大量结构重叠时是不够的。编码器倾向于学习描述的一般结构而非类别判别特征导致嵌入向共享均值坍缩。为显式对抗此问题我们引入各向同性正则化项惩罚每个嵌入 zⁱ 与L2归一化批次均值 z̄ 的均方余弦相似度阻止语义空间向由共享模板词汇驱动的质心坍缩语义编码器的组合训练目标为 ℒ_sem ℒ_SupCon γ ℒ_Iso其中 γ≥0 控制各向同性正则化相对于对比目标的强度。原型构建编码器训练完成后对每个类别 c∈S∪U类原型 t_c∈T 计算为其组成嵌入的L2归一化均值其中 S_c 表示属于类别 c 的描述样本集合。由此得到原型集合 Tₛ 和 Tᵤ作为后续所有对齐和推理的固定语义锚点。图3CIC-AndMal数据集上数据点使用预训练LLM左与对比微调LLM右的语义嵌入质量对比。3.3 通过元知识蒸馏进行跨模态对齐即使有了判别性语义原型由于精确的实例级行为观察与粗略、抽象的语义描述之间的粒度不匹配将 X 与 T 对齐仍然不平凡。我们通过一种结合元知识蒸馏Pan等2021与情景元学习的新颖框架来解决该框架在每一步训练中显式模拟零样本条件。双塔架构该框架在两个表示空间中运作。语义塔将类描述编码到 T产生第3.2节中导出的固定类原型 {t_c}。行为塔由投影网络 f_θ: X→T 组成学习将行为特征向量映射到共享语义空间对每个实例 xⁱ∈X 产生 ẑⁱ f_θ(xⁱ)∈ℝᴹ。情景元训练为防止 f_θ 过拟合于已见类对齐并显式强制泛化到未见类训练被组织为一系列模拟每一步零样本条件的情景学习回合。在每个回合中可用训练类集合 C_train 被随机划分为支持集 C_sup 和查询集 C_qry其中 C_train C_sup ∪ C_qry 且 C_sup ∩ C_qry ∅。查询集类被当作代理未见类——每回合有意保留的已知训练类以模拟新条件迫使 f_θ 将其跨模态对齐泛化到当前受监督类之外。双目标蒸馏损失损失函数平衡了支持类上的精确知识迁移与保留查询类上的泛化。令 s_{i,c} ẑⁱ · t_c / (||ẑⁱ||·||t_c||) 表示投影实例与原型 t_c 之间的余弦相似度。对于支持集学生通过蒸馏目标监督该目标结合了针对教师相似度分布的KL散度软知识迁移与硬交叉熵目标其中 T 为蒸馏温度ŝ_{i,c} 为教师的相似度logitsσ(·) 为softmax函数。KL散度迁移教师跨类的软关系结构而交叉熵项将学生锚定到正确的硬标签。对于查询集不提供蒸馏监督学生仅基于原型匹配进行评估作为泛化正则化器ℒ_qry ℒ_CE( ẑⁱ, yⁱ ), i∈C_qry。组合训练目标为其中 λ≥0 控制泛化惩罚相对于蒸馏目标的权重。3.4 通过自适应置信度门控进行广义推理Z分数置信度估计门控机制的核心观察是已见类实例产生的已见原型相似度分布具有一个显著主导的得分而未见类实例产生的分布更平坦、判别性更低如图4经验证。我们不将最高已见类得分与固定阈值比较而是评估其在每个样本的已见类相似度分布中的统计主导性。给定测试实例 xⁱ我们计算 ẑⁱ f_θ(xⁱ) 以及相对于每个已见原型 t_c∈Tₛ 的余弦相似度 s_{i,c}。然后计算该已见类相似度分布的每样本均值 μⁱ 和标准差 σⁱ最高已见类相似度 s_{i,max} max_{c∈S} s_{i,c} 的Z分数衡量其高于均值的标准差数其中 ϵ 确保数值稳定性当所有已见类相似度几乎相同时。路由决策Zⁱ 量化了给定样本的最佳已见类匹配在统计上的主导程度。高 Zⁱ 表示一个已见原型产生显著主导响应表明该实例属于已见类。低 Zⁱ 表示相似度分布平坦表明该实例相对于 S 是分布外OOD很可能属于未见类。路由决策形式化为其中 τ 是在验证集上优化以最大化已见类和未见类准确率之间调和平均的置信度阈值。该机制不需要额外学习参数完全基于推理时已计算的余弦相似度分数运行。图4按真实标签分层的每样本 σⁱ已见类余弦相似度标准差的分布。4 实验基线方法我们评估了9种能够进行零样本表格数据分类的方法——这是网络安全的关键要求——涵盖三种范式生成式Mishra等2018Verma等2020网络安全专用Wang等2025bAurna等2025Barros等2022以及基于LLM的Shi等2024Wang等2025aAli和Khan2023Yun等2024。我们还评估了TabPFNHollmann等2023、APTWu和Bergman2025a和ZEUSMarszałek等它们能在最少监督下泛化到新数据集但推理时仍需要每个未见类至少一个样本。因此这些模型不严格满足我们的GZSL形式化在单样本设置下评估。最后HistGradBoostPedregosa等2011和XGBoostChen和Guestrin2016作为标准表格分类基线。表1突出显示了各方法与SMETA-ZSL在四个轴向上的差异。ZET-LLMShi等2024、ProtoLLMWang等2025a和SMELLBarros等2022需要架构适应才能进行零样本推理而ZEUS、TabPFN和APT完全不支持因此仅纳入单样本比较。只有TabPFN和APT在训练时需要未见类原型。CLIP-decoderAli和Khan2023、P2TYun等2024、ZEUS和TZSLWang等2025b在训练时需要无标注未见实例。基线中仅CLIP-decoder和P2T支持开放集识别。SMETA-ZSL是唯一同时满足全部四个标准的方法。由于基线在放宽的假设上有所不同我们在各自的原生设置下评估每个基线同时将SMETA-ZSL全程置于最严格假设下。表1基线方法的需求与能力对比。勾选标记✓表示该方法是否原生支持零样本分类、是否可在不含未见原型或未标记未见实例的条件下训练以及是否具备开集识别能力。方法架构学习原理零样本分类无需未见原型训练无需未标记未见实例训练开集识别CVAE-ZSL (Mishra et al., 2018)VAE生成式原型学习✓✓✓✗MZSL (Verma et al., 2020)GAN MLP生成式元学习✓✓✓✗CLIP-decoder (Ali and Khan, 2023)ViT迁移学习✓✓✗✓P2T (Yun et al., 2024)LLM迁移学习✓✓✗✓ZET-LLM (Shi et al., 2024)LLM MLP特征提取✓ (改进型)✓✓✗ProtoLLM (Wang et al., 2025a)LLM原型学习迁移学习✓ (改进型)✓✓✗ZEUS (Marszałek et al.)LLM联邦学习✗✓✗✗TabPFN (Hollmann et al., 2023)LLM转导学习✗✗✓✗APT (Wu and Bergman, 2025a)LLM度量学习✗✗✓✗网络安全领域零样本学习​SMELL (Barros et al., 2022)MLP度量学习✓ (改进型)✓✓✗FL-ZSL (Aurna et al., 2025)MLP持续学习✓✓✓✗TZSL (Wang et al., 2025b)VQ-VAE迁移学习✓✓✗✗SMETA-ZSL​LLM MLP​原型学习元学习​✓​✓​✓​✓​数据集​ 我们在涵盖四个网络安全领域的七个基准数据集上评估了SMETA-ZSLCIC-AndMal-2020加拿大网络安全研究院(CIC)及加拿大网络安全中心(CCCS)2020、BODMASYang et al., 2021、APIGRAPHZhang et al., 2020、AVASTCTUBošanskỳ et al., 2022以及三个通用领域的表格数据集GOODREADSWan and McAuley, 2018; Wan et al., 2019、PETFINDERPetFinder.my, 2018、FAKEDDITNakamura et al., 2020。包含类别分布在内的数据集详细信息见表2。表2涵盖网络安全与通用领域基准的评估数据集概览数据集特征规模语义来源总类别数可见类未见类CIC-AndMal-2020动态行为特征API、内存、网络、logcat日志400,000网络威胁情报(CTI)报告26224BODMAS静态PE特征2381维134,435网络威胁情报(CTI)报告44404APIGRAPHAndroid API调用322,594网络威胁情报(CTI)报告74695AVASTCTU动态沙箱执行日志CAPEv2~49,000网络威胁情报(CTI)报告1073GOODREADS图书元数据页数、出版年份、评分10,000图书描述862PETFINDER宠物属性年龄、品种、性别15,000领养档案532FAKEDDIT帖子元数据得分、点赞比420,000标题/OCR文本642实现细节语义原型使用LLaMA-3.1-8B编码通过bitsandbytes以4位精度加载并用LoRA微调将每类行为描述嵌入4096维原型向量。投影网络 f_θ 是一个两残差块的MLP隐藏层大小1024GELU激活BatchNorm和dropoutp0.1将表格特征映射到 T 并输出L2归一化结果。所有超参数在验证集上调优敏感性分析见附录9。CTI报告收集CTI报告从两个开源仓库收集ORKL社区CTI库ORKL2024——一个可搜索的公共威胁情报报告语料库以及APT_REPORT档案CyberMonitor2024——一个社区维护的厂商和政府CTI文档集合。为确保覆盖所有恶意软件家族的语义特别是报告可用性有限的未见类我们采用了一个结构化增强流程提示LLM根据与每个恶意软件家族对应的MITRE ATTCK技术描述TTP生成合成CTI变体The MITRE Corporation2024。基于LLM的CTI生成已被探索作为解决威胁情报工作流中报告稀缺性的可行方法Ranade等2021。评估协议对于LLM微调我们使用90/10的训练/验证划分。未见类预先选定并在整个微调过程中保留。在元学习阶段我们保留15%的已见样本作为验证集15%作为测试集。未见家族数量根据数据集标签大小在3到2之间变化。我们遵循标准GZSL评估协议报告已见类准确率S、未见类准确率U及其调和平均H作为主要指标。调和平均作为主要排序标准因为它惩罚那些轻易偏向已见类或未见类的方法。结果在5次随机划分上平均并报告标准差。5 结果GZSL基线比较表3报告了7个表格基准包括网络安全和通用领域数据集上5次运行的GZSL结果。平均而言SMETA-ZSL在其领先的数据集上相较于最强基线将调和平均提高了约10.8个百分点最大提升出现在CIC-AndMal比MZSL高18.1、GOODREADS比ProtoLLM高11.6、AVASTCTU比FL-ZSL高12.5和APIGRAPH比TZSL高19.4。在FAKEDDIT上ProtoLLM领先47.80 vs 44.45其中基于原型的对齐似乎特别适合该数据集的多模态标签结构。SMETA-ZSL是在严格归纳假设下唯一在所有七个数据集上表现一致优异的方法。图5进一步展示了这一趋势SMETA-ZSL在所有七个基准上取得了最高的平均未见准确率同时保持了有竞争力的已见准确率。所有5次运行的已见、未见和平均准确率的完整结果见附录。表3七个表格数据集上的广义零样本学习GZSL结果。SMETA-ZSL在最严格的归纳式假设下进行评估基线方法则在其原生设置下评估。最佳结果蓝色标出表示可见类与未见类准确率之间的最高调和平均值。方法CIC-AndMalBODMASAPIGRAPHAVASTCTUGOODREADSPETFINDERFAKEDDITCVAE-ZSL17.56±2.6130.20±2.508.22±2.3224.85±7.2311.89±1.721.46±1.9514.33±4.05MZSL39.70±5.8942.23±4.9723.21±2.6222.27±14.7422.50±0.7230.96±1.0538.16±2.19CLIP14.34±3.7243.15±8.3921.49±4.5539.14±6.4618.76±0.9032.24±1.2536.56±14.66P2T0.00±0.000.00±0.000.47±0.490.48±0.107.81±0.932.52±0.680.55±0.35ZET-LLM13.03±1.2032.32±8.3612.67±1.570.01±0.0120.48±0.5523.14±0.781.05±0.19ProtoLLM38.15±0.6737.01±0.1921.59±0.1642.26±4.1524.34±0.2525.69±0.9147.80±0.20SMELL28.35±1.4827.60±2.1812.32±5.4536.71±1.0924.21±1.543.15±0.5921.10±5.52FL-ZSL29.43±3.2748.12±1.7627.16±2.5344.46±5.5421.89±1.0231.41±0.4221.20±4.65TZSL10.94±4.8841.20±9.4730.80±3.5929.67±23.090.00±0.006.13±0.3717.58±1.78SMETA-ZSL​57.78±1.02​50.20±9.10​50.19±3.61​57.00±1.22​35.92±2.50​33.36±0.58​44.45±4.28图5所有基准数据集上的平均已见类和未见类准确率。我们提出的SMETA-ZSL在所有比较方法中实现了最高的未见准确率同时保持了有竞争力的已见准确率。单样本基线比较表4将SMETA-ZSL零样本与少样本和标准表格基线进行比较。SMETA-ZSL在七个基准中的五个上取得了最佳调和平均在GOODREADS上高出15.0PETFINDER上10.4APIGRAPH上7.1。在BODMAS和AVASTCTU上HistGradBoost和ZEUS分别受益于SMETA-ZSL无法获得的带标签支持样本。尽管采用严格的零样本假设SMETA-ZSL仍然是整套基准中表现最稳定优异的方法。完全监督的上界结果见附录8。表4七个表格基准数据集上的单样本分类结果。SMETA-ZSL与专为小样本表格泛化设计的方法及标准表格分类器进行了比较。最佳结果蓝色标出。方法CIC-AndMalBODMASAPIGRAPHAVASTCTUGOODREADSPETFINDERFAKEDDITTabPFN36.28±0.3849.09±5.414.91±6.6142.14±1.310.00±0.000.00±0.0012.66±8.36APT51.92±1.1049.44±0.7211.54±0.6465.52±0.6620.57±0.7414.82±1.4010.59±3.07ZEUS47.29±0.6958.72±4.2243.12±0.9379.87±3.3120.97±3.7723.00±1.9740.84±3.50HistGradBoost37.21±1.0959.83±3.1838.93±0.9661.70±2.110.02±0.020.57±0.061.04±0.15XGBoost24.57±7.6027.85±17.821.67±1.089.26±10.320.00±0.000.00±0.000.00±0.15SMETA-ZSL​56.7±1.6​50.19±3.61​50.20±9.10​57.00±1.22​35.92±2.50​33.36±0.58​44.45±4.28​嵌入模型的影响表5报告了在保持SMETA-ZSL其余部分不变的情况下替换语义编码器对GZSL性能的影响。LLaMA3.1-8B是整体表现最佳的编码器在CIC-AndMal56.70±1.6和BODMAS50.19±3.61上均取得最高分。其方差也相对较低表明跨划分的语义原型稳定。表5语言模型对SMETA-ZSL的影响数据集Qwen-3-4BGemma-3-4BLLaMA3.1-3BLLaMA3.1-8BMistral-Nemo-Base-12BQwen-14BCIC-AndMal55.45±2.0354.34±3.5745.61±4.9356.70±1.637.14±6.7948.58±3.36BODMAS33.25±2.7648.71±2.2941.68±1.9650.19±3.6133.25±2.7648.30±5.02消融研究表6通过系统消融报告了各组件的贡献。移除LLM语义嵌入使调和平均平均下降9.3个百分点证实原型质量是性能的主要驱动因素。将情景元学习替换为标准训练显著降低了未见类准确率APIGRAPH -5.11AVASTCTU -4.88验证了训练期间模拟零样本条件的重要性。移除知识蒸馏带来较温和但持续的下降表明软关系迁移提供了硬标签监督之外的补充信号。少样本设置附录16考察了当每个未见类的标注样本从零增加到五时SMETA-ZSL的性能表现。随着样本数增加性能通常继续改善在K5时AVASTCTU上提升高达18.8个百分点但在K2之后收益递减。表6跨网络安全数据集的消融研究。每行移除或替换SMETA-ZSL的一个组件。配置CIC-AndMalBODMASAPIGRAPHAVASTCTU完整SMETA-ZSL56.759.1050.1957.00无LLM语义嵌入随机初始化36.1248.7146.1254.92无元学习回合54.6359.1145.0852.12无知识蒸馏55.7857.4144.5552.12将LLM替换为静态GloVe向量22.9933.9539.8449.33合成CTI的效果我们的问题空间存在核心数据稀缺问题每个恶意软件家族的真实CTI报告数量太少无法为优化监督对比目标提供足够的类内多样性。大规模配对的恶意软件-CTI数据在实践中难以获取因为组织通常发布恶意软件工件或CTI描述但很少两者都发布Johnson等2016MISP Project2024。这正是我们问题设定的前提如果恶意软件工件可用其对应的攻击描述可能不可用反之如果描述攻击的CTI报告被发布真实的恶意软件样本可能不被共享。为验证训练时合成CTI不会在测试时带来不公平优势我们完全移除未见类即仅在推理时出现的类的合成CTI仅使用真实CTI描述构建未见类原型同时保持已见类训练不变。如表7所示在两个数据集上使用和不使用合成CTI的未见准确率U和调和平均H在统计上无显著差异证实推理时性能由学到的跨模态对齐驱动而非合成CTI影响原型构建。表7合成CTI用于未见类原型构建的消融实验。S已见准确率U未见准确率H调和平均。数据集未见原型来源SUHCIC-AndMal仅真实CTI53.7550.0051.81真实合成CTI53.7550.6752.16BODMAS仅真实CTI66.7535.0045.92真实合成CTI66.5633.5044.57可复现性声明所有报告均值±标准差的实验在5次运行中重复使用不同随机种子。每种子结果见附录。超参数列于附录9。语义原型使用Llama-3.1-8B生成并以固定的.npy文件发布以避免非确定性。训练在3× NVIDIA RTX ADA 48GB GPU上进行。代码、检查点和预处理脚本可在 SMETA-ZSL/README.md at main · Security-And-Intelligence-Lab-UTEP/SMETA-ZSL · GitHub 获取。6 结论我们提出了SMETA-ZSL一个面向现实但尚未充分探索的网络防御场景的框架其中新威胁类别在缺乏标注行为样本、无标注未见实例或未见类先验知识的情况下出现。在实践中唯一可用的监督通常来自自然语言的CTI报告。我们表明大语言模型可以作为下游网络防御系统的语义适应接口将CTI转换为可迁移到结构化行为数据的判别性语义原型。在跨越四个网络安全和三个通用领域数据集的七个基准上SMETA-ZSL在更严格的开放集假设下持续优于先前方法平均改进基线10.8个百分点。