ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Watermarks for Embeddings-as-a-Service Large Language Models

Watermarks for Embeddings-as-a-Service Large Language Models 论文核心总结与翻译一、主要内容总结该论文聚焦嵌入即服务(EaaS)大语言模型的知识产权保护问题,围绕模仿攻击的攻防展开研究:背景与问题:EaaS因提供文本嵌入提取服务被广泛应用,但易遭黑盒模仿攻击,攻击者无需知晓模型内部机制即可克隆服务,给模型所有者带来经济损失;现有基于触发词的EaaS水印(如EmbMarker、WARDEN)存在安全漏洞。核心研究:提出复述攻击:通过对输入文本进行复述(含GPT-3.5复述、DIPPER模型复述、往返翻译等方式),可移除触发词并稀释水印权重,成功绕过现有EaaS水印检测。设计WET水印技术:基于线性变换的水印方案,通过预设变换矩阵对原始嵌入进行线性变换实现水印注入,验证时通过伪逆变换恢复原始嵌入并比对相似度,无需依赖触发词。实验验证:在Enron、SST2等4个数据集上验证,复述攻击能有效削弱现有水印效果,而WET在保持嵌入下游任务效用的同时,对复述攻击实现近乎完美的验证准确率(AUC=100%)。二、创新点揭示新漏洞:首次证明现有EaaS水印(依赖触发词)易受复述攻击,且在多种攻击配置和数据集下均成立。提出新型攻击方式:系统设计复述攻击框架,通过多轮复述+嵌入平均的方式稀释水印,为Ea
返回列表