公司动态

【文件分享】ActivityDiff:基于分类器引导扩散模型的活性可控分子生成框架

📅 2026/8/22 3:01:53
【文件分享】ActivityDiff:基于分类器引导扩散模型的活性可控分子生成框架
一、文章介绍新药设计不仅需要提升对目标靶点的活性还必须避免与非靶标蛋白发生不良相互作用——这些脱靶效应会严重损害药物的选择性和安全性。分析2010至2017年间的临床试验失败原因发现40%-50%的候选药物因疗效不足失败而30%因安全性问题被放弃其中非预期的脱靶相互作用是重要的促成因素。例如托西曲匹torcetrapib作为一种CETP抑制剂因脱靶激活盐皮质激素受体导致心血管事件增加在后期临床试验中被终止。这些案例凸显了一个紧迫需求需要能够在分子设计过程中不仅提升靶点亲和力还主动抑制有害脱靶效应的新方法。近年来深度学习在药物-靶点相互作用预测和药物设计中展现出巨大潜力。已有多种生成模型被用于在化学空间中导航以发现具有治疗活性的分子例如Pocket2Mol利用口袋结构生成结合分子KGDiff通过Vina评分引导生成过程。然而现有生成方法大多聚焦于单靶点活性优化在多靶点设计和选择性优化方面能力有限。少数研究尝试了多靶点药物设计如基于片段连接的方法DeLinker、DiffLinker虽然可行但易产生过大分子量的问题POLYGON和DRAGONFLY等新方法尝试通过强化学习或图神经网络实现多药理学设计但它们大多仅关注正向活性优化忽视了利用负向活性信息来抑制脱靶效应。为填补这一空白Huirun Zhu、Renyi Zhou及其合作者在Bioinformatics上发表了题为“ActivityDiff: a classifier-guided diffusion framework for activity-controlled molecular generation”的研究论文提出了一个名为ActivityDiff的基于扩散模型的分子生成框架旨在实现选择性、脱靶最小化和多靶点分子生成。ActivityDiff的核心创新在于通过分别训练的靶点活性分类器在扩散过程的每一步提供正负双向引导信号。该框架构建在离散去噪扩散模型之上将分子表示为完整图原子节点特征包括原子类型和形式电荷边特征包括键类型。在正向过程中分子图特征逐步被噪声破坏在反向去噪过程中模型学习恢复有效分子结构。关键创新在于分类器独立于生成模型训练使得新设计目标可以引入而无需重新训练生成模型大大降低了适应成本。在生成过程中正引导positive guidance提升对目标靶点的预测活性负引导negative guidance降低对非靶标/脱靶蛋白的预测活性。由于每个去噪步骤中的G t − 1 G_{t-1}Gt−1​同时包含原子和键特征引导信号同时指导节点和边的更新。多目标设计通过同时应用多个分类器引导实现——例如在BRAF-MEK双靶点生成中同时正向引导两个靶点分类器在HER2选择性生成中对HER2施加正引导、对EGFR施加负引导并将EGFR梯度正交投影到HER2梯度上以解决梯度冲突。此外ActivityDiff支持片段约束生成在保持已知活性片段的同时优化连接区域实现双靶点活性分子设计。在实验中ActivityDiff在无条件生成下VUN分数达0.975有效性0.978、独特性0.999、新颖性0.999。在六个靶点的单靶点正引导下68.6%的生成分子被分类器预测为高活性0.5而无条件生成仅1.2%负引导下85.7%的分子预测分数低于0.1展示了双向精准调控能力。在BRAF-MEK双靶点生成中双引导分子在两个靶点的预测分数均显著高于单引导在HER2选择性生成中特异性引导使EGFR预测分数0.5的比例从22.7%降至6.4%同时保持HER2高活性在六靶点脱靶谱规避中生成分子的脱靶风险显著低于实验活性分子。二、算法原理介绍ActivityDiff的算法设计围绕“离散扩散模型 → 独立分类器训练 → 分类器引导反向扩散”三个核心层次展开。一离散去噪扩散模型。分子表示为带N NN个原子的完全图G { V , E } G\{V,E\}G{V,E}节点特征为原子类型19种和形式电荷6种边特征为键类型无键、单键、双键、三键共4种特征均为离散类别变量。正向过程q ( x t ∣ x t − 1 ) Cat ( x t ; Q t x t − 1 ) q(x_t|x_{t-1}) \text{Cat}(x_t; Q_t x_{t-1})q(xt​∣xt−1​)Cat(xt​;Qt​xt−1​)通过转移矩阵Q t Q_tQt​逐步将特征转化为最大噪声状态π \piπ。反向过程p θ ( x t − 1 ∣ G t ) ∑ x ~ 0 q ( x t − 1 ∣ x ~ 0 , x t ) p θ ( x ~ 0 ∣ G t ) p_\theta(x_{t-1}|G_t) \sum_{\tilde{x}_0} q(x_{t-1}|\tilde{x}_0, x_t) p_\theta(\tilde{x}_0|G_t)pθ​(xt−1​∣Gt​)∑x~0​​q(xt−1​∣x~0​,xt​)pθ​(x~0​∣Gt​)训练神经网络从噪声图G t G_tGt​直接预测原始特征x 0 x_0x0​损失为交叉熵L diff E t , G 0 , G t [ − log ⁡ p θ ( x 0 ∣ G t ) ] \mathcal{L}_{\text{diff}} \mathbb{E}_{t,G_0,G_t}[-\log p_\theta(x_0|G_t)]Ldiff​Et,G0​,Gt​​[−logpθ​(x0​∣Gt​)]。训练时在不同噪声水平下使用信号-噪声比SNR加权使模型适应不同去噪阶段。二独立靶点分类器训练。每个靶点的分类器采用MPNN架构图编码器 Set2Set池化 MLP在BindingDB数据上训练为二分类器活性1000 nM为正≥10000 nM为负中间值通过log尺度插值生成[0,1]连续标签负采样比例1:10。关键设计训练时对输入分子添加与扩散过程相同分布的噪声使分类器能对中间去噪步骤的噪声分子进行有效评分。损失为SNR加权的二元交叉熵三分类器引导反向扩散。在去噪每一步将条件y yy期望的分子性质融入目标分布p ( G t − 1 ∣ G t , y ) ∝ p θ ( G t − 1 ∣ G t ) ⋅ p ϕ ( y ∣ G t − 1 ) p(G_{t-1}|G_t, y) \propto p_\theta(G_{t-1}|G_t) \cdot p_\phi(y|G_{t-1})p(Gt−1​∣Gt​,y)∝pθ​(Gt−1​∣Gt​)⋅pϕ​(y∣Gt−1​)。其中p θ p_\thetapθ​为无条件扩散模型p ϕ ( y ∣ G t − 1 ) p_\phi(y|G_{t-1})pϕ​(y∣Gt−1​)为分类器对当前噪声分子的预测概率。通过一阶泰勒展开近似log ⁡ p ϕ ( y ∣ G t − 1 ) ≈ log ⁡ p ϕ ( y ∣ G t − 1 ∗ ) ( G t − 1 − G t − 1 ∗ ) ⋅ ∇ G t − 1 log ⁡ p ϕ ( y ∣ G t − 1 ) ∣ G t − 1 G t − 1 ∗ \log p_\phi(y|G_{t-1}) \approx \log p_\phi(y|G_{t-1}^*) (G_{t-1} - G_{t-1}^*) \cdot \nabla_{G_{t-1}}\log p_\phi(y|G_{t-1})|_{G_{t-1}G_{t-1}^*}logpϕ​(y∣Gt−1​)≈logpϕ​(y∣Gt−1∗​)(Gt−1​−Gt−1∗​)⋅∇Gt−1​​logpϕ​(y∣Gt−1​)∣Gt−1​Gt−1∗​​使反向过程偏向满足条件的分子图。正引导使用∇ log ⁡ p ϕ ( y 1 ∣ G t − 1 ) \nabla \log p_\phi(y1|G_{t-1})∇logpϕ​(y1∣Gt−1​)增加预测活性负引导使用− ∇ log ⁡ p ϕ ( y 1 ∣ G t − 1 ) -\nabla \log p_\phi(y1|G_{t-1})−∇logpϕ​(y1∣Gt−1​)降低预测活性。多目标引导时梯度按目标组合如∇ combined ∇ target1 ∇ target2 − ∇ off-target \nabla_{\text{combined}} \nabla_{\text{target1}} \nabla_{\text{target2}} - \nabla_{\text{off-target}}∇combined​∇target1​∇target2​−∇off-target​通过正交投影解决潜在梯度冲突。引导信号同时作用于节点和边特征实现对分子结构的精细调控。三、总结ActivityDiff是一个基于离散扩散模型和分类器引导的活性可控分子生成框架通过正引导提升目标靶点活性、负引导抑制脱靶效应、多引导组合实现多靶点设计在单靶点、双靶点、选择性优化和脱靶规避等任务中均展示出灵活有效的调控能力。其核心创新在于将生成模型与靶点分类器解耦训练通过分类器在扩散每一步提供双向梯度信号使分子生成在优化正向活性的同时主动抑制有害脱靶相互作用。ActivityDiff在单靶点正引导下68.6%分子预测高活性vs 无条件1.2%负引导下85.7%分子预测低活性HER2选择性生成使脱靶EGFR预测高分比例从22.7%降至6.4%为兼顾疗效与安全性的多目标药物设计提供了灵活、可控的生成框架。