
如何用 AlphaFold 官方 Colab notebook 在本地部署前快速预测蛋白质结构【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold如果你手上有一段蛋白质氨基酸序列想立刻拿到结构预测而又不想先做完整的本地部署——AlphaFold 的本地完整部署需要准备 Linux 系统、Docker、NVIDIA Container Toolkit、现代 NVIDIA GPU以及最多 3 TB 磁盘空间来存放约 556 GB 的遗传数据库。官方仓库在 notebooks/AlphaFold.ipynb 提供了一个 Colab notebook用简化版的 AlphaFold v2.3.2 在云端浏览器里完成预测本地不安装任何东西结束时自动把预测结果打包下载。本文按 notebook 的实际 cell 顺序走一遍从序列输入到拿到预测结构 zip 包的完整流程并说明结果置信度怎么读、常见报错怎么处理。先明确Colab 版是简化的 AlphaFold v2.3.2notebook 开头明确列出了它与完整 AlphaFold v2.3.2 的差异这些会直接影响你对结果可靠性的判断不使用模板同源结构且只使用 BFD 数据库 的一个选定子集。官方说明称这些改动已在数千个近期 PDB 结构上验证过对多数目标精度与完整版几乎相同但有少数目标因为 MSA 更小、没有模板而出现明显精度下降。多聚体multimer的平均精度比本地安装版本略有下降且因为每个唯一序列都要单独做 MSA 搜索速度慢得多notebook 甚至可能超时。所以这条路径的定位是“部署前先快速跑一次”如果你的目标是最高可靠性官方建议直接使用完整开源版或 AlphaFold Protein Structure DatabaseREADME.md 中均有入口。准备条件GPU 运行时与序列长度限制运行环境需要 Google Colab 的 GPU 运行时。notebook 的 cell 2 会检查运行时设备TPU 会抛出Colab TPU runtime not supportedCPU 会抛出Colab CPU runtime not supported两者都不支持。修改方式是在 Colab 菜单RuntimeChange Runtime TypeHardware accelerator选择GPU。分配到的 GPU 型号因 Colab 资源而异free tier 下若长时间拿不到 GPUFAQ 建议稍后重试或使用 Colab Pro 获得优先 GPU 访问。本地零安装FAQ 明确说明 notebook 不会在你自己的电脑上安装任何软件一切在 Google Colab 云端完成最后才把预测 zip 包下载到你的电脑。输入序列限制cell 3 中的校验常量每条序列最短MIN_PER_SEQUENCE_LENGTH 16、最长MAX_PER_SEQUENCE_LENGTH 4000个氨基酸总长MAX_LENGTH 4000超过MAX_VALIDATED_LENGTH 3000时 notebook 会打印警告提示精度未完全验证、可能耗时很长或内存不足。模型自动选择只填一条序列时用 monomer 模型填多条序列时自动用 multimer 模型。monomer 模型上限 2500 个残基multimer 模型上限 4000 个残基且内存效率更高——对较大的单链cell 3 提供了use_multimer_model_for_monomers复选框可强制单序列走 multimer 模型。第 1 步打开 notebook 并运行两个 Setup cellREADME.md 开头给出了官方 Colab notebook 的入口链接打开后点击右上角的Connect连接运行时然后按顺序执行 Setup 部分的 2 个代码 cell点左侧 Play 按钮或RuntimeRun all。FAQ 特别强调5 个 cell 必须按顺序全部执行。cell 1Install third-party software在云端环境里安装依赖。notebook 自身注释标明“This installs the software on the Colab notebook in the cloud and not on your computer.” 它做的事情包括卸载 Colab 默认的 tensorflow/keras安装hmmer、py3dmol通过 Miniconda 安装python3.11、openmm8.0.0、pdbfixer并挂载一个 9 GB 的 tmpfs 到/tmp/ramdisk用于加速 Jackhmmer 数据库分块读取。cell 2Download AlphaFold克隆 alphafold 仓库、按requirements.txt安装依赖然后下载 Colab 专用的模型参数包alphafold_params_colab_2022-12-06.tar解压到./alphafold/data/params。cell 末尾会检查运行时设备GPU 正常时打印类似Running with {GPU型号} GPU的输出——看到这行打印说明两个 Setup cell 都通过了。第 2 步输入氨基酸序列cell 3在 cell 3 的文本框里粘贴要折叠的序列。输入框说明要求不带任何 header序列直接粘贴。sequence_1到sequence_20共 20 个字段多聚体把每条链填进不同字段。cell 自带一个文档示例序列可以直接拿来做试跑# cell 3 中 document 自带的默认示例序列MAAHKGAE...约 60 个氨基酸 sequence_1 MAAHKGAEHHHKAAEHHEQAAKHHHAAAEHHEKGEHEQAAHHADTAYAHHKHAEEHAAQAAKHDAEHHAPKPH运行后 notebook 会校验输入并打印选用的模型单序列打印Using the single-chain model.多序列打印Using the multimer model with {N} sequences.若总长超过 4000 或单链超过 monomer 上限 2500会直接抛出ValueError并提示可以勾选 multimer 选项重试。第 3 步MSA 搜索与预测cell 4 与 cell 5序列确认后用RuntimeRun after依次运行剩余 cell也可逐个点 Play 执行。cell 4Search against genetic databases先并发测试alphafold-colab、-europe、-asia三个数据源自动选用最快的一个然后用 Jackhmmer 对以下数据库做分块流式搜索因为完整数据库放不进 Colab 磁盘uniref902022_01 版smallbfd即 BFD 的选定子集mgnify2022_05 版仅当 multimer 且存在多条不同序列异聚体时额外搜索uniprot搜索过程有进度条完成后对每条序列打印形如{N} unique sequences found in {db_name} for sequence {i}的统计让你看到每个数据库命中的唯一序列数。注意 notebook 中模板特征是空占位num_templates0与开头的说明一致Colab 版不使用模板。cell 5Run AlphaFold and download prediction运行模型并输出结果。可调参数均为该 cell 内的表单参数注释即 notebook 原文# cell 5 的可调参数摘录 run_relax True # 是否执行 AMBER relaxation关闭后预测可能残留小的立体化学违规 relax_use_gpu False # GPU 上 relaxation 更快但稳定性更低若 GPU 上不收敛文档建议改回 CPU multimer_model_max_num_recycles 3 # multimer 的 recycle 上限追求更高精度可设 20代价是更长的推理时间模型执行方面monomer 模式按config.MODEL_PRESETS[monomer]model_1model_5再加model_2_ptm共运行 6 个模型multimer 模式运行 5 个model_*_multimer_v3模型见 alphafold/model/config.py。notebook 按置信度选出最佳模型对其做 AMBER relaxation生成可视化然后把整个prediction目录打包通过files.download自动把prediction.zip下载到你的电脑。耗时预期notebook 与 FAQ 的原文口径克隆源码和安装第三方软件各需几分钟数据库搜索和预测本身从几分钟到几小时不等取决于蛋白质长度和 Colab 分配给你的 GPU 型号。验证结果如何读 pLDDT 与 PAEcell 5 结束后你会在 notebook 里看到3D 结构可视化py3Dmol 渲染的 cartoon 按逐残基 pLDDT 着色旁边带Model Confidence图例分为四档Very low (pLDDT 50)、Low (70 pLDDT 50)、Confident (90 pLDDT 70)、Very high (pLDDT 90)multimer 还会额外给出按链着色的视图。pLDDT 曲线x 轴为残基、y 轴为 pLDDT0–100100 最可信的折线图。PAE 热图当模型输出 PAE 时multimer 模型一定输出额外绘制 Predicted Aligned Error 矩阵并用红线标出链边界。下载的prediction.zip内容selected_prediction.pdb经 AMBER relaxation 的最佳模型结构逐残基 pLDDT 存在 B-factor 字段注意 pLDDT 与 B-factor 含义相反数值越高越好predicted_aligned_error.jsonPAE 数据格式与 AlphaFold Protein Structure Database 一致仅在模型输出 PAE 时生成。notebook 在 “Interpreting the prediction” 一节给出的解读口径pLDDT 最适用于域内intra-domain置信度PAE 最适用于域间或链间between-domain / between-chain置信度。常见问题与对应处理以下现象与处理方式均出自 notebook 的 “FAQ Troubleshooting” 原文现象notebook 给出的处理Colab 长时间没有动静或报错先RuntimeRestart runtime无效则RuntimeFactory reset runtimeColab CPU runtime not supported或No GPU/TPU found经RuntimeChange runtime typeHardware accelerator改为 GPUCannot connect to GPU backendGPU 分配是动态的稍后重试Colab Pro 提供 GPU 优先访问警告Notebook requires high RAMColab 分配的资源有波动警告出现时仍可继续执行ModuleNotFoundError: No module named ...明明运行过安装 cellfree tier 存在空闲超时从头重新运行整个 notebookmultimer 的 MSA 搜索太慢导致超时使用 Colab Pro或改在本地运行完整 AlphaFold何时该转去完整本地部署Colab 版因为使用 BFD 子集且无模板在少数目标上精度明显下降multimer 的平均精度低于本地版本且搜索更慢。当你对可靠性有要求时按官方说法应改用完整开源版或查询 AlphaFold Protein Structure Database。README 的 “Installation and running your first prediction” 一节是本地路径的起点关键准备与命令摘录供你在 Colab 试跑之后对照使用# 1. 下载全部遗传数据库与模型参数556 GB 下载量解压后约 2.62 TB建议 SSD # DOWNLOAD_DIR 由你自己指定README 明确要求它不要放在 alphafold 仓库目录内 scripts/download_all_data.sh DOWNLOAD_DIR # 2. 构建 Docker 镜像 docker build -f docker/Dockerfile -t alphafold . # 3. 运行预测--data_dir 指向下载目录--output_dir 为绝对路径且需有写权限默认 /tmp/alphafold python3 docker/run_docker.py \ --fasta_pathsyour_protein.fasta \ --max_template_date2022-01-01 \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/absolute_path_to_the_output_dir其中your_protein.fasta换成你自己的 FASTA 文件$DOWNLOAD_DIR即上一步DOWNLOAD_DIR对应的路径。硬件要求更低时可用reduced_dbs参数下载缩减版数据库要求 8 个 vCPU、8 GB RAM、600 GB 磁盘并在运行命令中加--db_presetreduced_dbs。完整参数、输出文件结构ranked_0.pdb为置信度最高的预测等和排错说明见 README.md 的 “AlphaFold output” 与 “Running AlphaFold” 小节。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考