
文章核心总结与翻译一、主要内容本文针对大型语言模型(LLMs)在文本聚类任务中存在的无状态性(无法跨批次保留记忆)和聚类粒度难以控制两大核心问题,提出了名为LLM-MemCluster的端到端文本聚类框架。该框架无需模型微调或集成传统聚类算法,通过两大核心机制实现高效聚类:动态记忆机制(Dynamic Memory Mechanism):在提示词中维护动态更新的聚类标签集合,使LLM成为有状态的聚类主体,支持迭代式分配文档、创建新聚类、合并相似标签及追溯更新历史分配,确保全局一致性。双提示粒度控制机制(Dual-Prompt Strategy):基于当前聚类数量与用户设定的目标范围([Kmin, Kmax])动态切换两种提示模式——宽松模式(Relaxed Prompt)允许探索细粒度主题,严格模式(Strict Prompt)限制新标签创建并优先合并标签,实现聚类数量的精准控制。实验在6个不同领域、聚类数量18-102的基准数据集上展开,结果表明LLM-MemCluster在准确率(ACC)、归一化互信息(NMI)和调整兰德指数(ARI)等指标上显著优于传统方法(如K-Means、DBSCAN)、基于嵌入的方法(如BERTopic)及现有LLM增强方法(如ClusterLLM),且在不同LLM(GPT-4.1、Gemini、DeepSeek等)上具备良好的泛化能力,对超参数变化鲁棒性强。二、创新点提出无微调的LLM原生聚类范式,摆