
一、文章主要内容总结本文聚焦于利用大型语言模型(LLMs)实现个人身份信息(PII)脱敏的研究,旨在解决传统脱敏方法(如基于规则的系统、领域特定命名实体识别(NER)模型)泛化能力差、跨格式/跨语境适应性弱的问题。研究通过全面评估多种LLM架构(包括密集型LLM(D-LLM)、小型语言模型(SLM)、混合专家模型(MoE)、长文本模型(LRM)、结构化状态模型(SSM)等)和训练策略(全微调、指令微调、检索增强生成(RAG)等),从脱敏性能(准确率)、语义保留度、PII泄露风险(SPriV评分)、延迟及计算成本等维度进行分析。结果表明,指令微调的模型(如DeepSeek-Q1、Llama3.1-8B)在脱敏准确率和隐私保护上表现最优,且小型模型(如DeepSeek-Q1)可在较低计算成本下实现高性能。基于此,研究发布了开源工具套件PRvL,该套件基于开源LLM构建,支持多推理场景,可在自管理环境中部署,无需依赖第三方服务。二、创新点全面的评估框架:首次系统评估了6类LLM架构(D-LLM、SLM、MoE、LRM、SSM及NER基线)和3种训练策略(微调、指令微调、RAG)在PII脱敏中的表现,覆盖脱敏准确率、语义保留、隐私泄露、效率等多维度。开源工具PRvL:发布了首个基于开源LLM的PII脱敏工具套件,包含微调模型和评估工具,支持领域定制和安全自托管部署,解决了商业工具闭源、数据暴露风险等问题。跨维度权衡分析:深入分析了模型架构、训练策略在性能(准确率)