
AlphaFold 蛋白质结构预测完整实操指南5 分钟单体预测与蛋白复合物实战【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold手上有了一条蛋白质序列想知道它折叠成什么三维形状AlphaFold 的蛋白质结构预测能力正好解决这件事输入 FASTA 序列文件输出 PDB 格式的三维结构加置信度分数A100 GPU 上预测一条 100 残基的蛋白只需 4.9 秒不含序列搜索。本文以 DeepMind 开源的 AlphaFold 2 实现为例带你完成安装、跑通单体和蛋白复合物多链预测并讲清输出文件和常见坑。AlphaFold 是什么30 秒速览AlphaFold 是 DeepMind 开源的蛋白质结构预测系统给它氨基酸序列它先在多个遗传数据库里做序列搜索、构建多序列比对MSA即把大量同源序列对齐后一起看的家族图谱再由神经网络直接输出三维坐标最后用 Amber 力场做一轮松弛优化让结构的局部几何更合理。项目说明输入FASTA 格式的序列文件单链或多链输出PDB 结构文件 pLDDT / pTM / PAE 等置信度指标预测模式monomer单体、monomer_ptm带 pTM 置信度头、multimer复合物运行环境Linux NVIDIA GPU官方不提供 Windows/macOS 支持动手之前硬件和磁盘要准备什么配置项完整数据库full_dbs精简数据库reduced_dbsCPU建议 8 核 vCPU 以上8 核 vCPU内存建议 16GB 以上官方测试机 85GB8GB磁盘约 3TB数据库解压后 2.62TB约 600GBGPU现代 NVIDIA GPU显存越大能预测的蛋白越长同左数据下载量约 556GB明显更小无 1.8TB 的 BFD精简版牺牲一部分序列搜索质量换速度和磁盘空间适合先用小数据库跑通流程的场景。四步装好 AlphaFold 并下载数据 1. 装 Docker 和 GPU 支持先装 Docker 和 NVIDIA Container Toolkit让容器能访问 GPU并配好非 root 用户运行 Docker 的权限这两步参考官方文档即可。2. 克隆仓库git clone https://gitcode.com/GitHub_Trending/al/alphafold cd alphafold3. 下载数据库和模型参数最耗时的一步依赖aria2csudo apt install aria2然后后台跑下载脚本。完整库下载 556GB建议挂后台并记录日志scripts/download_all_data.sh /data/alphafold-dbs download.log 2 download_all.log 注意DOWNLOAD_DIR不要放在 AlphaFold 仓库目录内否则会被拷进 Docker 构建上下文构建会非常慢。4. 构建镜像、装依赖、验证 GPUdocker build -f docker/Dockerfile -t alphafold . pip3 install -r docker/requirements.txt用下面这条命令确认容器里能看到 GPU输出应列出你的显卡docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi示例一预测一条单体蛋白的结构先把序列写成 FASTA 文件后是序列名下面一行是氨基酸序列seq_001 MSRPEAKRQVSKQALKPQGQFGLL...然后运行预测入口 docker/run_docker.pypython3 docker/run_docker.py \ --fasta_pathsmonomer.fasta \ --max_template_date2021-11-01 \ --model_presetmonomer \ --data_dir/data/alphafold-dbs \ --output_dir/home/user/alphafold_output关键参数--fasta_paths序列文件支持逗号分隔多个会依次折叠文件内有多条序列时按复合物处理--max_template_date只使用该日期前发布的 PDB 结构做模板日期越接近当前数据模板越多--model_presetmonomer默认单体模型monomer_casp14是 8 倍集成算力贵 8 倍但平均 GDT 只高约 0.1主要用于复现monomer_ptm额外输出 pTM 分数--output_dir默认是/tmp/alphafold目录必须存在且可写预测要多久单张 A100不含 MSA 和模板搜索残基数预测耗时秒1004.9500291,000962,0004505,00018,824约 5.2 小时加--benchmarktrue可以把纯推理耗时写进输出目录的timings.json。示例二预测蛋白复合物Multimer复合物预测AlphaFold-Multimer的差别只有两处FASTA 里放多条链 --model_presetmultimer。以 A2B3 异源复合物为例seq_a_1 SEQUENCE_A seq_a_2 SEQUENCE_A seq_b_1 SEQUENCE_B seq_b_2 SEQUENCE_B seq_b_3 SEQUENCE_Bpython3 docker/run_docker.py \ --fasta_pathsheteromer.fasta \ --max_template_date2021-11-01 \ --model_presetmultimer \ --data_dir/data/alphafold-dbs \ --output_dir/home/user/alphafold_output同聚体多条相同链同理FASTA 里重复贴同一条序列即可。两个实用细节默认每个模型跑 5 个随机种子、5 个模型共 25 次预测算力吃紧时加--num_multimer_predictions_per_model1精度会略有下降复合物模式需要额外下载 UniProt 和 PDB seqres 数据库download_all_data.sh默认都会下好为什么现在的 multimer 模型更准v2.3.0 改动当前仓库默认的 multimer 权重就是 v2.3.0 重新微调的版本训练数据截止日期从 2018-04-30 推到 2021-09-30多了约 30% 的数据其中冷冻电镜结构是原来的 4 倍、2000 残基以上的大结构翻倍训练裁剪尺寸从 384 提到 640 残基训练时链数从 8 提到 20MSA 序列数上限从 1,152 提到 2,048。对特别大或困难的目标官方建议把每个模型的种子数提到 20、recycling模型预测-回喂迭代上限提到 20 并启用早停。完整细节见 docs/technical_note_v2.3.0.mdCASP15 基线预测结果在docs/casp15_predictions.zip。输出怎么看目录里一堆 PDB 有什么区别 跑完后结果在--output_dir下的子目录以目标名为目录名target_name/ ranked_{0,1,2,3,4}.pdb # 按置信度排序的结构ranked_0 最优 relaxed_model_*.pdb # Amber 松弛后的结构 unrelaxed_model_*.pdb # 模型原始输出 result_model_*.pkl # pLDDT、pTM、PAE 等原始数值 ranking_debug.json # 排序依据 timings.json # 各阶段耗时 msas/ # 序列搜索结果几个高频指标pLDDT每残基置信度0~100越高越可信存在 PDB 的 B-factor 字段里。注意它和传统 B-factor 方向相反——pLDDT 越高越好用它做分子置换等任务时别搞反pTM整体结构打包的置信度monomer_ptm和multimer模型输出PAEpredicted aligned error残基对之间的预期对齐误差矩阵图能看出哪些区域/哪些链之间相对关系可靠判断复合物界面时特别有用默认只有 pLDDT 最高的那个模型会做松弛--models_to_relaxbest可以改成all或none松弛默认走 GPU快但偶有不稳定--enable_gpu_relaxfalse可切回 CPU。常见坑与排查 ⚠️症状原因与解法容器里看不到 GPU先跑nvidia-smi测试命令查 NVIDIA Container Toolkit 是否装对Docker 构建异常慢或直接报错数据库目录放在了仓库内run_docker.py会主动拒绝这种情况挪到仓库外MSA 工具报莫名其妙的错数据库目录读写权限不足对下载目录执行chmod 755递归授权磁盘不够改用reduced_dbs且下载和运行要配套脚本传reduced_dbs参数、运行时加--db_presetreduced_dbs想反复调同一序列的参数加--use_precomputed_msastrue复用已算好的 MSA前提是输出目录和序列都没变显存装不下长序列run_docker.py已设置TF_FORCE_UNIFIED_MEMORY1和XLA_PYTHON_CLIENT_MEM_FRACTION4.0借用主机内存仍不够就加显存或缩短序列构建时出现 CUDA 源 GPG 签名错误属已知的仓库源签名问题处理办法见仓库 issue 区源码在哪目录结构一览想改行为或排查问题主要看这几处均为仓库内相对路径run_alphafold.py # 容器内真正的推理入口 docker/run_docker.py # 命令行参数定义与 Docker 启动 alphafold/model/model.py # 模型主体RunModel alphafold/data/feature_processing.py # 序列/MSA/模板特征处理 alphafold/data/pipeline.py # 推理管线MSA、模板、排序 alphafold/relax/relax.py # Amber 松弛 alphafold/model/geometry/ # 刚体、旋转矩阵等几何计算下一步可以做什么先用 Colab 试水仓库自带简化版 Notebooknotebooks/AlphaFold.ipynb不占本地 3TB 磁盘适合先验证序列和流程批量预测对同一序列反复跑用--use_precomputed_msastrue省 MSA 时间大规模场景官方建议基于RunModel.predict自写并行管线复现 CASP14 结果加--max_template_date2020-05-14限制模板范围并使用当年版本的数据库确认许可代码是 Apache 2.0模型参数是 CC BY 4.0发表成果需引用 AlphaFold 论文及 Multimer 预印本输出仅用于理论建模不用于临床目的12Jumper J, Evans R, Pritzel A, et al. Highly accurate protein structure prediction with AlphaFold. Nature, 2021, 596(7873): 583-589.↩Evans R, ONeill M, Pritzel A, et al. Protein complex prediction with AlphaFold-Multimer. bioRxiv, 2021.↩【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考