ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

KDD 2026 | PRIME:一种用于从头设计binder的 3D 分子模型

KDD 2026 | PRIME:一种用于从头设计binder的 3D 分子模型 《PRIME: A Pretrained Representation-Induced Model for 3D Molecules in De Novo Binder Design》这篇论文主要解决的是大分子如多肽、抗体的三维结构生成与结合物Binder从头设计问题。研究团队提出了一种名为PRIME的新框架通过引入预训练的基础模型和一种创新的采样策略大幅提升了生成分子的亲和力功能性、几何合法性结构真实度和多样性。链接https://dl.acm.org/doi/10.1145/3770855.38188871. 研究背景与核心挑战在药物设计中生成能够与特定靶点紧密结合的多肽或抗体Binder是一项核心任务。近年来潜在扩散模型Latent Diffusion Models, LDMs在3D分子生成中大放异彩。但现有的LDM方法如UniMoMo等面临两个致命的挑战挑战一“可扩散性鸿沟”Diffusability Gap现有的LDM通常会从头训练一个自编码器Autoencoder将3D坐标压缩到潜在空间然后在该空间中进行扩散。由于这个编码器仅仅是为了“最小化重构误差”而训练的它学到的潜在空间往往充满了高频的、不规则的局部变化缺乏生化物理规律的语义约束。这导致扩散模型很难在这个“崎岖”的空间中平滑地生成合法的分子结构。挑战二各向同性噪声与静态条件约束的局限传统的扩散模型在采样初始化时使用各向同性高斯噪声各方向随机的白噪声但这忽略了蛋白质是线性链状拓扑结构这一物理事实导致模型在去噪早期需要耗费大量精力去修复断链等局部破损。在条件生成如给定受体口袋生成结合物中传统方法在整个去噪过程中施加恒定强度的条件引导。这在早期会导致模型过于僵化无法探索更多样的结构空间陷入局部最优。2. 核心创新点 (Contributions)为了解决上述问题作者提出了PRIME框架其核心贡献可以概括为“一个替换”和“两项策略”引入基础表示骨架Foundation Representation Backbone打破“从头训练编码器”的惯例直接使用冻结的Frozen3D预训练大模型本文使用的是 EPTEquivariant Pretrained Transformer作为特征提取器。这样可以直接继承大模型在大规模无监督学习中掌握的强大物理、几何和生化先验知识彻底跨越“可扩散性鸿沟”。提出语义保持探索性采样SPES, Semantics-Preserving Exploratory Sampling这是一种在推理采样阶段的创新策略包含两个子模块GLSN (图拉普拉斯谱噪声)用于改进初始噪声使其符合蛋白质链的拓扑结构。CFM (条件自由度调制)用于动态调整条件引导的强度平衡“探索多样性”与“保证生成质量”。3. 方法论详解 (Methodology)图1PRIME 框架概览。A训练流程采用了一个冻结的基础编码器Foundation Encoder从输入结构中提取“语义-几何”潜在表示并在此基础上优化可训练的潜在扩散模型Latent Diffusion Model和几何解码器Geometric Decoder。B在“语义保持探索性采样SPES”的推理流程中以图拉普拉斯谱噪声GLSN作为初始噪声起点逆向扩散过程在“条件自由度调制CFM”策略的控制下逐步对噪声变量进行细化去噪随后由几何解码器重构出最终的全原子结合物binder结构。C为了进一步阐明 SPES 模块的机制GLSN 会构建一个链状图并计算其拉普拉斯矩阵旨在将初始噪声投影到低频模式上从而注入“感知主链连通性”的扰动。逆向扩散轨迹会迭代地细化含噪潜变量同时CFM 会根据中间预测结果评估每个分子块per-block的结构稳定性并动态调整条件上下文通过放宽对不稳定区域的约束同时收紧对稳定区域的引导以此来增强生成结果的多样性。A. 基础表示骨架 (Foundation Representation Backbone)做法给定一个输入的3D分子结构先用冻结的 EPT 编码器将其转化为包含语义特征和3D坐标的 block-level残基/分子块级别潜在表示。训练两步走训练一个几何解码器 (Geometric Decoder)学习如何把上述固定潜在表示还原回真实的3D全原子结构。在这个固定的潜在空间中训练一个潜在扩散模型 (Latent Diffusion Model)。优势因为 EPT 编码器是不参与训练且已经具备极强生化常识的所以在这个空间里进行扩散生成的分子天生就更符合物理法则如不会轻易发生原子碰撞。B. 语义保持探索性采样 (SPES)这是在模型训练好后生成推理阶段的技术GLSNGraph Laplacian Spectral Noise - 拓扑感知初始化原理蛋白质是一条链。作者利用图信号处理技术构建了一条链状图并计算其图拉普拉斯矩阵。作用在扩散过程的第TTT步注入初始噪声时不再使用纯白噪声而是将其投影到该图的低频模式上类似“粉红噪声”。这种低频噪声保留了全局的骨架连贯性避免了局部高频振荡。相当于告诉模型“你一开始面对的虽然是噪声但它是一条像意大利面一样的链条噪声而不是一盘散沙。”CFMConditional Freedom Modulation - 稳定性驱动的动态引导原理引入一个“动态稳定性得分”。在扩散的每一步计算当前预测的3D坐标与上一步相比的变化幅度。变化小说明结构开始“稳定”了。作用在去噪早期结构不稳定CFM 会“模糊”或减弱受体口袋提供的条件信号Condition给模型极大的自由度去探索 (Exploration)不同的结合姿态随着去噪进行结构逐渐稳定CFM 会逐渐收紧条件加强引导让模型精细打磨 (Refinement)局部互作。这是一种“先放飞自我后精雕细琢”的策略。4. 实验与结果分析 (Experiments)作者在统一的多肽 (LNR) 和抗体 (RAbD) 零样本 (De Novo) 设计基准上进行了严格测试并使用 Rosetta 能量函数作为评估标准。主要结果 (Main Results)多肽设计 (LNR Benchmark)相比于之前的SOTA模型 UniMoMoPRIME 将亲和力提升指标 (IMP) 从 29.03% 大幅提升至38.89%界面能量 (ΔG) 降低至 -33.56。同时生成配体的均方根误差 (RMSD) 从 1.48 Å 降至1.01 Å且原子碰撞率 (Clash rate) 极低。这证明了PRIME完美打破了“结构僵化”与“高亲和力”之间的Trade-off。抗体CDR设计 (RAbD Benchmark)在抗体这种极度灵活的分子设计上PRIME 同样刷新了 SOTA。亲和力提升 (IMP) 达到69.49%RMSD 降至 0.97 Å且序列和结构的多样性Diversity显著提升。图2代表性生成设计的定性结构分析。 该可视化结果将生成的结合物蓝色与靶点受体口袋灰色内的天然参考结构粉色进行了叠加对比。消融实验 (Ablations - 证明为什么有效)作者把 PRIME 拆开来验证每个模块的作用见论文 Table 3只用 Foundation Backbone结构合理性Clash rate大幅下降因为预训练大模型守住了物理底线但生成的结构多样性很差因为潜在空间太严格了。加入 GLSN结构多样性翻倍0.11 - 0.22证明遵循拓扑的噪声能帮助模型跳出局部最优。加入 CFM亲和力 (IMP) 进一步提升证明“先探索后约束”确实能帮模型找到能量更低的结合构象。三者结合 (PRIME)取得了各项指标的最佳平衡。5. 总结与评价 (Conclusion)核心结论PRIME 成功开创了“基于预训练表示诱导”的3D生物分子生成新范式。它证明了我们不需要、也不应该为了扩散模型去从头强行压缩3D分子直接站在 3D Foundation Models 的肩膀上并辅以符合物理直觉的采样策略SPES就能高效生成兼具高保真度、高亲和力和高多样性的结合大分子。亮点评价直击痛点敏锐地指出了当前 LDM 中自编码器带来的“可扩散性鸿沟”解决方案直切要害。物理直觉强GLSN链状拓扑噪声和 CFM稳定性动态调制的设计极具启发性完全遵循了蛋白质折叠和分子对接的物理逻辑。统一框架将多肽和抗体的设计统一在一个框架下证明了方法的普适性。局限性作者已提及目前模型的评估高度依赖于计算代理指标如 Rosetta 能量和预设的参考结构这不能完全替代湿实验Wet-lab的真实验证结果。此外高性能的 Binder 生成技术也伴随着一定的生物安全风险Dual-use risks。
返回列表