ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

药物研发中的类药性评价:从经典规则到AI预测的实战指南

2026/8/3 2:01:29 拓冰建站 浏览量
药物研发中的类药性评价:从经典规则到AI预测的实战指南 1. 从“直觉”到“量化”类药性评价的行业演进在药物研发的早期阶段评价一个化合物是否“像药”很大程度上依赖于化学家的经验和直觉。一个结构新颖、合成路线清晰的分子在资深化学家眼里可能因其“长得太丑”或“看起来有毒”而被早早放弃。这种基于经验的“化学直觉”虽然宝贵但主观性强、难以传承且随着化合物库规模从几千个膨胀到几百万、几十亿个人力已无法逐一审视。于是“类药性”这个概念从一种模糊的定性描述逐渐演变为一套可量化、可计算、可预测的指标体系。它不再是“这个分子看起来顺不顺眼”而是变成了“这个分子的理化性质、结构特征是否落在已知成功药物的统计分布区间内”。对于药物化学家、计算化学家以及从事早期药物发现的科研人员而言掌握类药性评价不仅是筛选海量化合物的必备技能更是理解药物分子设计底层逻辑、避免在错误分子上浪费宝贵研发资源的关键。今天我们就来深入拆解“类药性”评价的方方面面从经典规则到现代算法从理论计算到实战应用。2. 类药性的核心维度不止是“五规则”提到类药性很多人首先想到的是著名的“Lipinski五规则”。这确实是基石但它仅仅是冰山一角。一个具有良好类药性的分子通常需要在多个维度上达到平衡。2.1 理化性质药物在体内的“通行证”这是类药性最基础的层面决定了分子能否被有效吸收并输送到作用靶点。分子量MW并非越小越好但过大绝对是障碍。Lipinski规则建议口服药物分子量最好小于500 Da。这是因为分子量直接影响跨膜扩散速率。分子量过大其水合半径增大被动扩散通过细胞脂质双分子层的效率会急剧下降。在实战中对于中枢神经系统药物分子量要求往往更严通常450 Da以利于穿透血脑屏障。脂水分配系数LogP/LogD这是衡量分子亲脂性的关键参数。LogP辛醇-水分配系数描述的是中性分子的脂溶性而LogD在特定pH如生理pH 7.4下测定更能反映体内环境的真实情况。Lipinski规则建议LogP不大于5。一个LogP过高的分子如5虽然容易穿透细胞膜但可能在体内分布过于偏向脂肪组织水溶性极差难以通过血液运输也容易在代谢中产生蓄积毒性。反之LogP过低如0的分子亲水性太强难以穿透脂质细胞膜生物利用度会很低。理想的LogP范围通常在2-3之间这是一个在溶解度和膜渗透性之间取得最佳平衡的“甜蜜点”。氢键供体HBD与受体HBALipinski规则限定HBD ≤ 5 HBA ≤ 10。氢键能力直接影响分子的水溶性、与靶点蛋白的结合特异性以及跨膜能力。过多的氢键供体/受体会增强分子与水分子之间的相互作用使其“困在”水相中难以进入并穿越疏水的细胞膜。在药物设计中常通过将极性基团如羟基、胺基甲基化或成环来减少暴露的氢键数量以改善膜渗透性。可旋转键数量Rotatable Bonds这个参数由Veber等人强调通常要求≤10。可旋转键越多分子构象越灵活在进入蛋白结合口袋时所需的构象熵损失就越大不利于结合亲和力。同时过多的柔性也可能导致代谢不稳定。刚性结构的分子往往具有更好的选择性和代谢稳定性。极性表面积PSA/TPSA这是预测药物吸收尤其是肠道吸收和血脑屏障穿透的强力指标。它计算的是分子表面极性原子氧、氮及相连氢的面积总和。通常口服吸收好的药物其TPSA最好小于140 Ų而能够有效穿透血脑屏障的CNS药物TPSA通常要求小于90 Ų甚至更低如60-70 Ų。这是一个比单纯数氢键更精确的描述分子极性的参数。注意这些规则是“经验性”的而非“绝对法则”。它们来源于对已上市口服小分子药物的统计分析。因此存在许多成功的“规则打破者”。例如某些抗生素或天然产物衍生物可能违反多项规则但仍能成药。规则的意义在于预警——违反规则的分子成药概率显著降低需要你有更强有力的理由如独特的给药途径、前药设计、针对特殊靶点来支持继续推进。2.2 结构特征避开“化学警报”有些化学结构或子结构本身具有较高的反应活性或毒性被称为“结构警报”或“毒性基团”。一个分子即使理化性质完美如果含有这些“坏片段”其开发风险也极高。反应性基团如迈克尔受体α, β-不饱和羰基、酰卤、磺酸酯、环氧化物等。这些基团容易与生物大分子如蛋白质、DNA中的亲核基团巯基、氨基发生不可逆的共价结合导致非特异性的细胞毒性和遗传毒性。代谢不稳定基团如未取代的芳胺、酯键、特定位置的羟基等可能在体内被快速代谢失活或转化为有毒产物。泛筛选干扰化合物PAINS这是一类更隐蔽的“坏结构”。它们本身可能没有强毒性但会在基于高通量筛选的生化实验中表现出假阳性活性。例如某些富含醌、邻苯二酚、罗德明染料的化合物可能通过氧化还原循环、荧光淬灭、非特异性聚集等方式干扰检测信号其活性并非来自与靶点的特异性相互作用。将含有PAINS结构的化合物误判为苗头化合物会导致后续大量的资源浪费。在实战中利用诸如RDKit、OpenEye等化学信息学工具包可以方便地对化合物库进行基于SMARTS模式的子结构搜索快速过滤掉这些高风险结构。2.3 合成可行性能否被制造出来一个理论上完美的分子如果合成路线极其冗长、收率低下、需要使用昂贵或危险的试剂其开发价值将大打折扣。类药性评价也需要考虑合成可及性。合成复杂性评分SCScore这是一种基于反应数据训练的机器学习模型可以预测合成一个分子的难易程度评分1-5越高越难。在项目早期对苗头化合物进行SCScore评估有助于优先选择那些更容易通过后续的构效关系优化得到大量类似物的核心骨架。官能团兼容性分子中的某些官能团可能在后续的合成修饰中带来挑战。例如在需要钯催化交叉偶联的反应中如果分子中存在对钯催化剂有毒的含硫基团就需要额外的保护/去保护步骤。3. 超越规则数据驱动的现代评价方法随着人工智能和机器学习在药物发现领域的渗透类药性评价早已不再局限于几条简单的规则。3.1 定量估计类药性QEDQED是一种将多个类药性参数如分子量、LogP、氢键、极性表面积、可旋转键、芳环数、结构警报综合为一个0到1之间分数的加权几何平均方法。分数越接近1表示其整体类药性越好。与简单罗列各项参数相比QED提供了一个直观的、可排序的单一指标非常适合用于对大型虚拟化合物库进行初步排序和优先级划分。主流药物设计软件如Schrödinger, MOE和开源工具RDKit都内置了QED计算功能。3.2 基于AI的类药性/成药性预测模型这是当前的前沿方向。模型不再仅仅依赖人工定义的规则和描述符而是直接从海量的分子结构和其对应的成功/失败数据中学习模式。方法一基于分子描述符的机器学习模型。首先计算分子的大量描述符数千个包括二维的拓扑描述符、三维的几何描述符、电性描述符等然后使用随机森林、支持向量机或梯度提升树等算法训练一个分类是否类药或回归类药性分数模型。这类模型的性能高度依赖于训练数据的质量和描述符的表征能力。方法二基于深度学习的端到端模型。直接以分子的SMILES字符串或图结构原子为节点化学键为边作为输入通过循环神经网络RNN、图神经网络GNN或Transformer架构自动学习分子的特征表示并输出预测结果。例如一些研究使用在大量化合物库如ChEMBL上预训练的GNN模型来预测化合物的类药性、溶解度或渗透性。这类方法能捕捉更复杂、非线性的结构-性质关系潜力巨大。实战心得在实际项目中我通常会采用“规则过滤 模型预测”的组合拳。首先用Lipinski、Veber等规则和结构警报进行快速硬过滤剔除明显不合格的化合物。然后对剩余的化合物使用QED或内部训练的AI模型进行打分排序。这样可以兼顾效率和准确性。需要警惕的是任何预测模型都有其适用范围和偏差对于结构非常新颖、不在训练集分布内的分子模型的预测结果可能不可靠此时仍需结合化学家的经验进行判断。4. 实战工作流从虚拟筛选到先导化合物优化让我们以一个虚拟的案例串联起类药性评价的全流程。假设我们有一个全新的靶点蛋白通过虚拟筛选从一个包含1000万化合物的商业库中寻找苗头化合物。步骤1初筛与预处理。使用RDKit或OpenBabel对库中所有化合物进行标准化处理去盐、生成互变异构体、质子化状态枚举。然后运行第一轮“硬性”过滤分子量150 Da MW 700 DaLogP-2 LogP 5氢键供体/受体HBD ≤ 5 HBA ≤ 10可旋转键≤ 10极性表面积≤ 140 Ų子结构过滤移除所有含有预定义反应性基团和PAINS结构的分子。 这一步可能过滤掉80%-90%的化合物剩下约100-200万。步骤2基于对接得分的粗选。对剩余的化合物与靶点蛋白进行分子对接根据对接打分如Glide Score, Vina Score排名选取前1%约1-2万个的化合物。这一步关注的是理论上的结合能力。步骤3类药性精细评分与排序。对接排名靠前的化合物其结构可能千奇百怪。此时需要引入类药性评价进行“纠偏”。计算每个化合物的QED分数。如有内部训练的类药性AI模型也在此阶段进行预测打分。综合对接打分和类药性打分例如对接打分权重70%类药性打分权重30%得到一个综合排名。人工审查排名前100-200的化合物。审查重点包括结合模式是否合理关键相互作用是否形成、结构新颖性、合成可行性SCScore、以及是否存在任何在自动过滤中可能漏掉的细微结构问题如潜在的代谢位点。步骤4聚类与代表性分子选取。为了避免选出结构高度相似的化合物需要对Top化合物进行基于分子指纹如ECFP4的聚类。从每个主要聚类中挑选1-2个综合得分最高、且类药性最好的分子作为代表性苗头化合物进入下一轮实验验证。通常我们会挑选出20-50个化合物进行初步的生化活性测试。步骤5先导化合物优化中的持续评价。获得具有微摩尔级活性的苗头化合物后进入构效关系研究阶段。每设计一个类似物在合成之前都必须对其进行新一轮的类药性评价。此时评价会更加精细ADMET预测使用专门的模型预测其渗透性Caco-2, P-gp底物可能性、代谢稳定性CYP450酶抑制/代谢、毒性hERG通道抑制、遗传毒性等。这些是比基础类药性更接近临床失败的“高级过滤器”。性质平衡优化过程中活性 potency的提升常常伴随着LogP的升高疏水相互作用增强可能导致溶解性下降、毒性风险增加。药物化学家需要在“活性-类药性-安全性”这个不可能三角中寻找最佳平衡点。常用的策略包括引入极性基团如酰胺、醇来降低LogP将芳环替换为饱和环或杂环来降低分子平面性、改善溶解度通过前药设计改善不良的理化性质。踩坑实录我曾参与一个项目苗头化合物活性很好IC50 10 nM但LogP高达5.2且含有一个未取代的芳胺结构警报。在优化中团队一味追求将活性提高到1 nM以下采用了增加疏水基团的策略结果LogP飙升至6.5芳胺警报也未解决。尽管体外活性惊艳但该化合物在初步的肝微粒体代谢实验中半衰期极短5分钟且显示出明显的细胞毒性。项目最终夭折。教训是类药性评价必须贯穿始终不能为了追求单一的活性指标而牺牲其他所有性质。在苗头化合物阶段就应制定明确的优化策略同步改善活性和类药性缺陷。5. 工具与资源从业者的武器库工欲善其事必先利其器。以下是一些在类药性评价中常用的工具和数据库开源工具/库RDKit化学信息学的瑞士军刀。可以计算所有主流类药性描述符MW, LogP, HBD/HBA, TPSA, 可旋转键等、实现子结构过滤、计算QED、生成分子指纹。是Python环境下进行批量化合物分析的基石。OpenBabel强大的化学文件格式转换和命令行处理工具可用于初步的分子标准化和描述符计算。Molinspiration / SwissADME优秀的在线免费平台。只需提交SMILES或上传文件即可快速获得包括类药五规则、极性表面积、合成可及性分数等在内的全面类药性报告以及ADME的初步预测结果非常适合快速评估单个或少量分子。商业软件Schrödinger Suite其LigPrep模块可用于分子准备QikProp模块专门用于预测类药性和ADME性质提供数十个相关参数及其允许范围并与已知药物数据库进行对比非常直观。MOE (Molecular Operating Environment)提供完整的描述符计算、构效关系分析和ADMET预测模块。StarDrop以其“多参数优化”和“敏感性分析”功能见长能直观展示化学空间帮助在优化中平衡多个相互冲突的性质如活性 vs. 溶解度。关键数据库ChEMBL包含大量具有生物活性的药物样分子及其实验数据是训练和验证类药性/ADMET预测模型的黄金数据源。DrugBank收录已批准药物、实验药物及其详细信息的综合数据库是定义“类药”空间的重要参考。ZINC庞大的商业可用化合物虚拟库常用于虚拟筛选其子集如ZINC15 “drug-like”已经过初步的类药性过滤。在实际工作中我通常的流程是用RDKit写脚本对大规模库进行自动化预处理和基础过滤对于进入精细评估阶段的数十到数百个分子则会使用SwissADME进行快速交叉检查并利用商业软件进行更深入的ADMET预测和可视化分析确保从不同角度获得一致的评价结论。6. 评价的边界与常见误区类药性评价是一个强大的工具但我们必须清醒认识其局限性避免陷入误区。误区一将类药性等同于成药性。这是最常见的误解。类药性主要关注分子固有的物理化学和结构特性是成药性的必要不充分条件。一个类药性优秀的分子仍可能因为靶点本身不可成药、缺乏体内药效、或存在无法克服的毒性而失败。成药性是一个更广泛的概念涵盖了药效学、药代动力学和安全性全部内容。误区二盲目追求高分扼杀创新。如果严格遵循所有规则可能会将一些结构新颖、作用机制独特的“黑马”分子过早淘汰。例如很多天然产物和肽类药物的分子量、LogP都远超规则限制但它们通过特殊的转运机制或给药方式成功上市。评价规则应作为“风险提示器”而非“死刑判决书”。误区三过度依赖计算忽视实验验证。所有的计算预测都是基于模型的而模型基于历史数据。对于全新骨架或作用机制的化合物预测结果不确定性很高。类药性计算应该用于优先级排序和风险预警最终的判断必须依靠实验数据。例如预测溶解度差但实际测定可能发现其晶型具有出乎意料的好溶解度预测hERG风险高但体外电生理实验可能证明是安全的。误区四忽略物种差异和疾病领域特殊性。评价标准并非一成不变。开发抗菌药或抗寄生虫药时由于靶点位于细菌或寄生虫体内对分子穿透哺乳动物细胞膜的要求可能降低。开发外用制剂如皮肤软膏时对口服吸收相关规则如TPSA的要求可以大幅放宽。必须根据具体的给药途径和治疗领域来调整评价的重点。因此一个成熟的药物发现团队会将计算预测、化学经验与早期实验数据如微溶解度测定、肝微粒体稳定性测试紧密结合形成快速迭代的反馈循环。类药性评价是这一循环中的关键决策辅助工具它的价值在于提高决策的效率和科学性而不是替代科学决策本身。理解这些规则的来源、原理和边界才能在实际项目中灵活、恰当地运用它们真正提升药物研发的成功率。