ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

5 个文件快速读懂 AlphaFold 预测结果:可靠性怎么判断

2026/9/11 3:52:22 拓冰建站 浏览量
5 个文件快速读懂 AlphaFold 预测结果:可靠性怎么判断 5 个文件快速读懂 AlphaFold 预测结果可靠性怎么判断【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold跑完一次预测输出目录里会堆出一堆 PDB、JSON、PKL从哪里下手第一步打开ranked_0.pdb按 B 因子列着色pLDDT 置信度曲线立刻呈现。再配合confidence_*.json看残基分档、pae_*.json看区域间相对位置是否可靠。看懂这 5 类 AlphaFold 输出文件判断预测结果可靠性的流程只要 10 分钟。AlphaFold 输出一共有哪些文件清单先给结论真正要做决定的是 5 类文件——结构、置信度、误差矩阵、松弛指标、模型排名其余都是中间产物。文件它回答什么问题什么时候要看ranked_0.pdb~ranked_N.pdb多个预测里哪个最可靠原子在哪里第一步看结构时confidence_{model_name}.json每个残基可不可信属于哪一档看置信度曲线时pae_{model_name}.json任意两个残基的相对位置误差有多大判断结构域运动、结合界面时relax_metrics.json松弛之后还剩多少结构违例结构看起来别扭时ranking_debug.json多个模型按什么依据排出先后多模型里选最优时unrelaxed_*.pdb/relaxed_*.pdb分子动力学松弛前后结构变了多少对比松弛前后差异时result_{model_name}.pkl、features.pkl模型原始输出和输入特征做源码级分析时timings.json各阶段耗时排查速度问题时这些文件全部由 run_alphafold.py 中的predict_structure函数写出{model_name}形如model_1。如何分层读 AlphaFold 输出文件原子、残基、组合结论固定按先看原子、再看残基、最后看组合的顺序读越到后面越接近生物学问题跳层读容易误判。原子层PDB 里每个原子坐标怎么看PDB 文件每行 ATOM 记录一个原子的坐标AlphaFold 把 pLDDT每个残基的局部置信度藏进了标准的 B 因子列——这个设计让你用 PyMOL 等通用软件直接按颜色显示可信度不用任何插件。ATOM 17 N MET A 1 0.291 -47.464 9.182 1.00 4.39 N这是仓库测试数据里的一行4.39就是 pLDDT 值低于 50属于最低档。坐标单位为埃。查看动作在 PyMOL 里加载后一行命令着色load ranked_0.pdb spectrum b整条链按 B 因子从冷色到暖色过渡哪里可信、哪里飘动一眼可见。残基层pLDDT 的 4 档怎么读confidence_*.json给每个残基一个 0 到 100 的分数alphafold/common/confidence.py中的_confidence_category函数把它切成四档档位分数区间白话含义D0–49很可能是无序区坐标不可用L50–69低置信局部结构可能摆动M70–89中等二级结构一般可信H90–100高接近实验结构的清晰度查看动作把 JSON 里的confidenceCategory数组丢给jq做group_by计数一行命令就能得到各档残基数HM 占比就是整体可靠性的粗略度量。组合层PAE 矩阵怎么读pLDDT 只回答这个残基自己准不准不回答它和另一个残基的距离准不准。PAEPredicted Aligned Error预测对齐误差是一个 N×N 矩阵PAE[i][j]即残基 i 与 j 相对位置的预测误差埃。pae_*.json里的predicted_aligned_error就是这个矩阵保留 1 位小数max_predicted_aligned_error是取值上界。若两个结构域各自的对角块低、交叉块高模型在说每个域内部我都有把握但它们的相对朝向是猜的。查看动作import json, numpy as np pae np.asarray(json.load(open(pae_model_1.json))[0][predicted_aligned_error]) print(pae.max(), (pae 8).sum() / pae.size)交叉验证3 步判断预测结果可不可信结论先行残基档、组合层、松弛检查三者都过了结构才值得引用。1️⃣看整体档位confidence_*.json中 HM 占比高于八成说明整体折叠可信出现大段 D 档就标记该区域。 2️⃣看 PAE 交叉块挑出你关心的两个功能区域看它们行列交叉处的数值——低则相对位置可靠整片偏高则域间关系不可引用。 3️⃣看松弛指标relax_metrics.json里remaining_violations_count接近 0说明结构物理上站得住数值大表示仍有空间冲突或二面角违例。⚠️ 三个常见坑先说现象再给原因现象pLDDT 处处高但结构里两个结构域明显不接触。原因pLDDT 是局部指标两个域可以各自为 H相对位置其实没把握只有 PAE 交叉块能暴露这一点。现象序列中段出现一长串低于 50 的分数。原因不一定是预测失败可能对应蛋白质自身的天然无序区D 档是模型在如实报告。现象relaxed_*.pdb坐标与unrelaxed_*.pdb对不上。原因Amber 松弛会调整结构消除冲突前后 RMSD 由 alphafold/relax/relax.py 中AmberRelaxation.process计算记录小幅偏移属正常。深入源码从哪个文件切入想追每个输出文件的来历去写出逻辑而不是模型网络里找主流程是 run_alphafold.py 的predict_structure按顺序写出置信度、PAE、未松弛/已松弛 PDB 与 ranked 文件。分数计算集中在 alphafold/common/confidence.pycompute_plddt与pae_json各只有几十行可一次读完PDB 的生成在 alphafold/common/protein.py 的to_pdbB 因子的写入点值得细看松弛逻辑在 alphafold/relax/ 目录想弄清模型吃了什么再预测看 alphafold/data/pipeline.py 的特征构建。结尾3 条可以直接执行的建议看新结构先做spectrum b把 D 档低于 50区域列成清单作为后续标注的起点。写两个结构域形成稳定界面这类结论前先查 PAE 交叉块查不出低值就不要写。置信度整体偏低时先核对运行用的是full_dbs还是reduced_dbs预设run_alphafold.py的db_preset参数——比对序列数据库太稀疏会压低分数别把数据配置问题归因于序列本身。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考