
1. 项目概述当AI特工遇上“杀猪盘”最近几年无论是社交媒体、交友软件还是电商客服基于对话的诈骗Conversational Scams——也就是我们常说的“杀猪盘”、情感诈骗、投资诈骗等——已经泛滥成灾。这些骗局的核心不再是简单的钓鱼链接而是利用精心设计的话术、长期的情感培养和复杂的情景剧本在对话中一步步诱导受害者。传统的基于关键词或静态规则的风控系统面对这种动态、长周期、高度语境化的攻击往往力不从心误报和漏报是家常便饭。更棘手的是当系统好不容易拦截到一个可疑对话风控或审核人员往往面对的是长达数百甚至数千条的消息记录。人工回溯整个对话链条理解诈骗分子的意图演进和受害者的心理变化不仅效率极低而且极易因疲劳而忽略关键转折点。我们需要一个能像经验丰富的反诈专家一样持续监控对话、理解上下文、识别诈骗模式并且能清晰解释“为什么怀疑这次对话”的智能系统。这就是“An Explainable Agentic System for Detection of Conversational Scams with Summary-Based Memory”这个项目要解决的核心问题。它不是一个简单的分类器而是一个具备“智能体”Agentic特性的系统。所谓“智能体”意味着它能够主动感知对话环境、根据记忆进行决策、并执行分析动作。其核心创新在于“基于摘要的记忆”Summary-Based Memory和“可解释性”Explainable的结合。简单来说这个系统会像一个拥有“速记本”和“推理白板”的侦探一边实时对话一边不断提炼对话摘要存入记忆当发现可疑迹象时不仅能报警还能在白板上画出完整的“作案动机与手法示意图”告诉你它怀疑的理由和证据链。2. 系统核心架构与设计哲学2.1 为什么是“智能体”架构传统的检测模型通常是“被动式”的。它们将一段完整的对话记录或一个时间窗口内的片段作为输入一次性输出一个欺诈概率。这种方式有几个致命缺陷无法处理超长对话模型有输入长度限制长对话需要被截断丢失大量历史信息。缺乏实时性只能在对话结束后或定期批量分析无法在诈骗进行中实时干预止损效果差。忽略对话的动态性诈骗是一个过程信任是逐步建立的。一次性分析无法捕捉“关系升温”、“切入投资话题”、“制造紧急感”等分阶段的策略演变。智能体架构将检测任务框架为一个持续的“感知-思考-行动”循环。系统化身为一个虚拟的对话监控员Agent持续“聆听”每一条新消息。它拥有自己的“工作记忆”短期记忆和“知识库”长期记忆并能根据当前消息和记忆内容自主决定是否需要深入分析、触发警告或更新对对话风险的认知。这种架构天然适配实时、流式的对话场景并能通过记忆机制处理任意长度的历史信息。2.2 “基于摘要的记忆”是如何工作的直接存储所有原始对话到记忆里是不现实的会导致信息过载和检索效率低下。人类专家在复盘长对话时也是在心中构建一个不断演进的“故事摘要”。本项目中的“基于摘要的记忆”正是模拟这一过程。记忆模块由两部分构成动态摘要和记忆向量库。动态摘要不是一次性生成的而是随着对话滚动更新的。假设当前对话已有N轮系统会维护一个当前摘要S_N。当第N1条消息到来时系统并非将整个对话重新摘要而是执行一个“记忆更新”操作输入 当前摘要 S_N, 新消息 M_{N1}, 以及可能的相关历史消息片段从向量库检索得出 处理 模型如LLM被要求“基于现有摘要 S_N 和新信息 M_{N1}更新你的摘要重点反映对话主题、双方关系、关键承诺或请求的变化。” 输出 更新后的摘要 S_{N1}这个过程极大地压缩了信息同时保留了对话的叙事主线。例如摘要可能从“双方在寒暄”演变为“用户A在倾诉情感困扰用户B在提供安慰并塑造成功人士形象”再演变为“用户B开始提及一个低风险高回报的投资机会”。记忆向量库则用于存储更细粒度的信息。每当摘要更新或对话中出现关键实体如金额、联系方式、平台名称、情感强烈表达或已知诈骗模式的关键节点如“要照片”、“诉苦”、“提钱”系统会将这些关键信息片段可以是单条消息或一个小的消息块编码成向量存入向量数据库如ChromaDB, Weaviate。这个向量库的作用是供系统在需要“回忆”细节时进行语义搜索。当最新消息提到“那个比特币项目”系统可以快速从向量库中检索出几天前关于该项目收益承诺的对话细节实现精准的上下文关联。2.3 “可解释性”不只是输出一个分数对于高风险应用如反诈黑盒模型是无法被信任的。本系统的“可解释性”设计贯穿始终目标是提供决策溯源报告。当系统判定某对话风险极高时它生成的不仅仅是一个“99%欺诈”的标签而是一份结构化的报告包含风险摘要用一两句话概括核心风险点如“对话疑似‘杀猪盘’正从情感培养阶段转向诱导投资阶段”。证据链按时间顺序列出支撑该判断的关键对话片段从记忆向量库中检索得出并标注每个片段所对应的典型诈骗剧本阶段例如[阶段2: 建立信任]“对方称你为‘宝贝’并分享虚构的奢华生活照片”。模式匹配指出当前对话与哪些已知的诈骗话术模式Pattern相匹配。这些模式可以是预定义的规则也可以是从历史数据中聚类学习得到的。智能体推理过程展示智能体在关键决策点的“思考”日志通过LLM的Chain-of-Thought prompting实现。例如“用户突然索要电话号码。检索记忆发现三天前他曾诱导提及‘资金周转’。结合‘快速拉近关系后索要联系方式’的诈骗模式风险等级提升至高。”这样的解释让审核人员能够快速理解系统的判断依据进行高效复核同时也为模型迭代提供了宝贵的反馈数据。3. 核心模块拆解与实现要点3.1 智能体决策引擎的实现决策引擎是系统的大脑它决定在接收到新消息后“做什么”。我们通常实现一个基于规则与LLM协同的混合决策器。一个简单的决策流程可以如下class DetectionAgent: def process_new_message(self, dialog_id, new_message): # 1. 感知获取当前上下文 current_summary self.memory.get_summary(dialog_id) relevant_memories self.memory.retrieve_relevant(dialog_id, new_message) # 2. 思考评估风险并决定行动 decision_prompt f 你是一个对话安全监控AI。当前对话摘要{current_summary} 最新消息{new_message} 相关历史信息{relevant_memories} 请评估风险等级[低 中 高]并决定下一步行动 - 行动A低风险仅更新摘要和记忆。 - 行动B中风险更新记忆并生成一个内部风险标记记录怀疑点。 - 行动C高风险冻结对话如需实时拦截生成详细的可解释报告通知人工审核。 请以JSON格式输出包含risk_level action和reason简要说明理由。 decision self.llm_invoke(decision_prompt) # 调用LLM如GPT-4或本地微调模型 # 3. 行动 if decision[action] A: self.memory.update_summary(dialog_id, new_message, current_summary) self.memory.store_detail(dialog_id, new_message) elif decision[action] B: # ... 类似但增加风险标记 self.risk_registry.mark(dialog_id, decision[reason]) elif decision[action] C: report self.explainer.generate_report(dialog_id, decision[reason]) self.alert_human(report) # 可能触发自动干预如发送防骗提醒给潜在受害者注意完全依赖LLM进行每一次决策成本高且延迟不稳定。生产环境中会结合快速规则过滤器。例如先使用关键词布隆过滤器或轻量级文本分类模型筛出明显高风险消息如包含“稳赚不赔”、“裸聊”等只有中低风险或复杂场景才触发完整的智能体推理流程以平衡效果与成本。3.2 记忆模块的工程化考量记忆模块的稳定性和效率至关重要。摘要更新策略频繁调用LLM更新摘要代价大。可以采用“增量更新”与“定期重整”相结合的策略。每5-10条消息触发一次增量更新每累积50条消息或检测到话题显著转变时进行一次从原始消息片段的“全量重整”以纠正增量更新可能累积的偏差。向量检索优化存储每条消息的向量不现实。更佳实践是存储“信息单元”。例如将每3-5条连续消息作为一个语义单元进行编码存储或者专门抽取并存储事件如“对方索要银行账户”、情感转折点如“受害者表达焦虑”。检索时使用最新消息的向量同时查询这些“单元”返回最相关的几个。这比检索单条消息更能保持上下文连贯性。记忆的遗忘与压缩对话可能持续数月记忆不能无限膨胀。需要设计“遗忘机制”。对于摘要可以保留最重要的主干逐渐淡化早期无关细节。对于向量库可以基于时间衰减和相关性评分进行清理只保留对当前风险判断仍有参考价值的历史片段。3.3 可解释报告生成器这是将智能体内部状态转化为人类可理解信息的关键。报告生成器需要调用记忆模块中的各种信息。证据收集根据决策引擎提供的风险点和理由从向量记忆中检索出所有相关的对话片段、历史摘要版本。时间线构建将这些证据按时间顺序排列勾勒出诈骗剧本的推进脉络。叙事化整合使用一个专门的LLM以“撰写一份给审核员的案件分析报告”为指令将风险摘要、时间线证据、模式匹配结果整合成一篇流畅、有说服力的文本。报告应使用清晰的标题、项目符号和引用如[消息#123]并高亮关键风险语句。实操心得在训练或提示设计报告生成LLM时提供大量“对话记录-人工撰写报告”的配对样本至关重要。报告的风格应冷静、客观、基于事实避免使用情绪化词汇重点突出违反平台政策或已知诈骗模式的具体言行。4. 系统工作流程与实操部署4.1 端到端的工作流程假设一个名为“欺诈猎手”的系统部署在某个社交平台其处理单条新消息的完整流程如下消息接入与预处理平台将用户A与用户B的对话流实时推送至系统。系统对新消息进行基础清洗去除乱码、标准化格式。快速过滤消息经过一个高速的规则引擎和轻量级模型层。如果触发高危关键词如“赌博”、“汇款到安全账户”可能直接进入紧急拦截流程并跳过后续复杂分析以节省资源。记忆检索系统根据对话ID从记忆存储中取出该对话当前的动态摘要S_curr。同时将新消息编码成向量在对话专用的向量子空间中检索出最相关的K条历史信息单元M_related。智能体决策将S_curr,M_related, 新消息内容以及对话元数据用户画像、注册时间等一起送入决策引擎。引擎输出风险等级、行动指令和初步理由。记忆更新无论风险等级如何系统都会调用摘要更新器将新消息整合进摘要生成S_new并持久化。同时判断新消息是否为需要长期记忆的关键节点若是则将其作为信息单元存入向量库。行动执行若为行动A流程结束等待下一条消息。若为行动B在对话的风险元数据中记录此次事件可能提升该对话的监控优先级。若为行动C报告生成器被触发。它利用当前所有记忆S_new, 相关向量记忆、风险标记历史生成一份详细的可解释报告。随后系统执行预设动作a) 向审核员后台推送高风险警报及报告b) 可选地向潜在受害用户发送一条系统警告消息如“请注意保护财产安全谨防诈骗”c) 可能暂时限制诈骗嫌疑账号的某些功能。人工反馈闭环审核员收到报告后做出最终裁定是/否诈骗。这个裁定结果会作为黄金标签回流到系统用于优化决策引擎和报告生成器的模型微调或强化学习形成闭环。4.2 部署架构与性能优化这样一个系统对延迟和吞吐量有较高要求。典型的微服务部署架构可能包括消息接入层使用Kafka或Pulsar作为消息队列缓冲海量对话流实现解耦和削峰填谷。无状态处理层决策引擎、报告生成器等作为无状态服务部署在Kubernetes上根据队列负载自动扩缩容。状态存储层动态摘要和对话元数据存储在Redis等内存数据库中保证低延迟读写。向量记忆存储在专用的向量数据库如Milvus, Pinecone中它们为高维向量的快速近似最近邻搜索进行了优化。模型服务层将LLM如经过微调的LLaMA或ChatGLM通过Triton Inference Server或vLLM进行封装提供高性能、批处理的模型推理API。性能优化关键点异步处理报告生成等耗时操作应异步执行不影响主检测流水线的实时性。主流水线只负责决策和触发异步任务。缓存策略频繁访问的对话摘要、用户风险画像等在Redis中进行多级缓存。模型蒸馏将大型LLM如用于决策的70B模型的知识蒸馏到更小的模型如7B或13B在保证效果不明显下降的前提下大幅提升推理速度、降低部署成本。5. 挑战、应对策略与未来展望5.1 面临的主要挑战对抗性进化诈骗分子会不断改变话术绕过检测。系统必须具备持续学习的能力。策略建立高效的人机闭环。审核员的反馈必须快速用于模型迭代。可以设计一个“新模式发现”模块自动聚类被人工判定为诈骗但系统未识别出的对话提炼新的话术模式加入模式库。误报与用户体验过度干预如误发警告会严重损害正常用户的体验。策略实施分级干预机制。高风险操作如禁言、封号必须经过人工确认。自动发送的用户警告消息需谨慎措辞采用提醒而非指控的口吻例如“请注意网络上存在虚假投资诈骗。对于任何涉及金钱往来的建议请保持警惕。” 同时建立误报补偿机制。多语言与跨文化场景诈骗剧本因地区和文化差异巨大。策略核心架构可以统一但需要针对不同语言和文化训练本地化的LLM模型和构建本地化的诈骗模式知识库。摘要生成和报告生成也需要适配本地语言。隐私与合规处理私密对话内容涉及严格的隐私法规。策略系统设计必须遵循“隐私设计”原则。可以采用联邦学习在本地训练模型而不输出原始数据在必须上传分析时进行严格的匿名化处理如脱敏个人信息并确保所有数据访问有完整的审计日志。5.2 效果评估的独特指标不能只用准确率、召回率来评估这样一个复杂系统。需要一套综合指标实时拦截率在资金损失发生前系统成功触发干预的诈骗对话占比。平均检测时间从诈骗对话开始到系统首次标记为高风险的平均时长。越短越好。报告质量分数由人工审核员对系统生成的可解释报告进行评分评估其清晰度、证据充分性和帮助决策的有效性。审核效率提升比对比引入系统前后审核员处理同等数量警报所需的时间。5.3 未来可能的演进方向这个项目打开了一扇门其“智能体记忆可解释”的范式可以扩展到更广泛的领域扩展应用场景同样的架构可用于检测网络欺凌、骚扰言论、虚假信息传播等任何需要理解长上下文和意图的对话安全场景。记忆的抽象化当前的记忆更多是文本摘要和片段。未来可以尝试让智能体构建更结构化的记忆如“知识图谱”记录对话中的人物关系、事件、承诺和矛盾点使推理更加深入。多模态融合诈骗不仅限于文字。结合语音情感分析、图片OCR识别诈骗图片中的联系方式、虚假截图等多模态信息可以构建更强大的防御体系。协同智能体部署多个具有不同专长的智能体如一个擅长识别情感诈骗一个擅长识别金融诈骗让他们对同一对话进行“会诊”通过辩论或投票机制做出更稳健的集体决策并生成更全面的解释。构建这样一个系统最大的体会是它远不止是一个机器学习模型的应用而是一个复杂的、人机协同的工程系统。它要求我们不仅关注算法的前沿更要深刻理解业务场景的复杂性、用户体验的细微之处以及工程落地的现实约束。每一次成功的拦截背后都是数据、算法、工程和领域知识紧密协作的结果。在实际部署中与业务审核团队的紧密沟通从他们那里获取反馈、理解他们看报告的视角往往比调优模型参数更能提升系统的实际价值。这个项目让我看到AI赋能安全正在从简单的“过滤”走向深度的“理解”与“辅助决策”而可解释性是这一切得以信任和落地的基石。