ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

从一段氨基酸序列到三维结构:AlphaFold蛋白质结构预测上手实战

2026/9/11 13:01:19 拓冰建站 浏览量
从一段氨基酸序列到三维结构:AlphaFold蛋白质结构预测上手实战 从一段氨基酸序列到三维结构AlphaFold蛋白质结构预测上手实战【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold当你手里只有一段氨基酸序列却需要知道它在空间里怎么折叠时——X射线晶体学等实验手段昂贵且以月计而 AlphaFold 蛋白质结构预测只需要一个 FASTA 文件和一块 GPU就能还给你一份带原子坐标的三维结构。这个开源项目就是 AlphaFold v2 的官方推理管线输入序列它完成多序列比对、模板检索、神经网络推理和物理精修最后输出一组 PDB 结构文件。下面按「准备 → 运行 → 判读 → 排障」的顺序把整条链路走一遍。能力速览30 秒建立合理预期动手装环境之前先明确它能做什么、不做什么核心能力是单链蛋白monomer的三维结构预测蛋白质-蛋白质复合物也能做但 multimer 属于实验性质官方明确说不如单链稳定每个预测都自带置信度逐残基的 pLDDT部分模型还会给 pTM 和 PAE后面会教怎么看只支持 Linux 加 NVIDIA GPU没有 Windows 或 Mac 版本显存越大能预测的蛋白越长它不预测配体结合、不做构象动态分析输出仅用于理论建模不能用于临床全套遗传数据库解压后约 2.62 TB磁盘规划要放在第一步考虑最后一点最容易被低估。官方 README 写明完整数据库下载量约 556 GB、解压后 2.62 TB如果空间紧张reduced 版reduced_dbs只需约 600 GB 磁盘后面跑的时候加一个参数就行。落地准备环境、依赖、数据一次到位硬件底线是 Linux 系统、一块较新的 NVIDIA GPU官方在 A100 上做的性能基准、SSD 存储——序列检索阶段 I/O 很密集机械盘会明显拖慢 MSA多序列比对就是把同源序列对齐成一张矩阵是预测精度的主要来源。软件侧需要 Docker、NVIDIA Container Toolkit让容器能直通 GPU和 aria2c并行下载工具。三步装好第一步拿代码和数据。克隆仓库后用官方脚本一次性拉下全部遗传数据库和模型参数git clone https://gitcode.com/GitHub_Trending/al/alphafold cd alphafold scripts/download_all_data.sh DOWNLOAD_DIR download.log 2 download_all.log 这里有几个容易踩的坑DOWNLOAD_DIR不要放在仓库目录里面否则几 TB 的数据库会被拷进 Docker 构建上下文镜像构建会慢到怀疑人生556 GB 的数据量务必放后台跑别守在终端前磁盘不够就改成scripts/download_all_data.sh DOWNLOAD_DIR reduced_dbs下载精简版但运行时必须配套加--db_presetreduced_dbs数据目录要有完整读写权限否则 MSA 工具会以各种莫名其妙的报错方式提醒你第二步构建镜像并验证 GPU。docker build -f docker/Dockerfile -t alphafold . docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi第二条命令应当列出你的 GPU列不出来说明 NVIDIA Container Toolkit 没配好先解决它再往下走。构建时若遇到 CUDA 源的 GPG 签名报错README 指向了一个已知的 workaround按提示处理即可。第三步安装启动器依赖。宿主机上执行pip3 install -r [docker/requirements.txt](https://link.gitcode.com/i/2461fa81779dd912bebff5f463a3c4e8)建议放虚拟环境里免得污染系统 Python再确认输出目录默认/tmp/alphafold存在且可写。核心工作流从 FASTA 到 PDB第 1 步准备输入序列用 FASTA 格式写下氨基酸序列。单链就是一个序列想预测复合物的话把多条序列放进同一个文件——一个文件里有多条序列工具就会按 multimer 输入处理。同型寡聚体比如三条相同序列也照样写三份就行。第 2 步发起预测python3 docker/run_docker.py \ --fasta_pathsyour_protein.fasta \ --max_template_date2022-01-01 \ --model_presetmonomer \ --db_presetreduced_dbs \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/absolute_path_to_output几个关键参数值得记住--model_preset选模型monomer默认CASP14 原始配置、monomer_ptm带 pTM 置信度头、multimer复合物需要额外下载 UniProt 和 pdb_seqres 数据库--db_preset是速度/质量权衡reduced_dbs只需 8 vCPU、8 GB 内存、600 GB 磁盘full_dbs则是 CASP14 的完整数据库配置--max_template_date限制模板结构的最晚发布日期主要用于复现历史基准日常预测可以不设--models_to_relax控制精修范围best默认只精修置信度最高的、all或none--gpu_devices指定用哪几块卡默认吃满所有可见 GPU第 3 步内部在跑什么一次预测实际分四段先用 JackHMMER 等工具去 BFD、MGnify、UniRef90 里搜同源序列并拼成 MSA——进化信息是精度的主要支柱再到 PDB 里找结构上已知的相似模板然后 5 个独立模型各自推理出一份结构最后置信度最高的那份送进 Amber 力场做能量最小化修掉局部立体化学问题。时间预期单块 A100不含 MSA 和模板搜索100 残基约 5 秒500 残基约 30 秒1000 残基约 1.5 分钟2000 残基约 7.5 分钟4000 残基超过 1.5 小时。长蛋白的 MSA 检索时间往往比推理本身还长别盯着 GPU 利用率等。结果判读不只看结构还要看置信度跑完后--output_dir下会生成一个以靶名为名的子目录文件内容ranked_0.pdb~ranked_4.pdb按置信度排序的 5 个预测ranked_0最优unrelaxed_model_*.pdb模型原始输出未经精修relaxed_model_*.pdb经过 Amber 力场精修的结构result_model_*.pkl模型原始张量pLDDT、distogrampTM 模型还有 ptm 和 PAEmsas/各检索步骤产出的 MSA 中间文件features.pkl喂给模型的输入特征数组timings.json等各阶段耗时、排序依据、精修后的违规统计pLDDT 分数怎么看pLDDT0~100越高越可信存在输出 PDB 的B 因子字段里。注意它和晶体学 B 因子的方向正好相反——那里越高代表越无序所以拿去做分子替换之类下游任务时要格外小心。pLDDT 区间含义典型位置 90极高置信核心结构域、进化上高度保守的区域70–90高置信大多数有功能的结构域50–70中等置信连接肽、保守性较弱的区域 50低置信可能是本征无序区结论需谨慎如果整条链的平均 pLDDT 都压在 50 以下先怀疑序列本身或 MSA 里同源证据不足而不是急着否定结构。PAE 和 pTM 怎么看这两个只有monomer_ptm和multimer模式才会输出。PAE 是一个 N×N 矩阵记录任意两个残基之间的预测对齐误差对角线块高说明域内部还算稳非对角线块高则说明两个结构域的相对摆位不可信——多结构域蛋白判断「整体形状对不对」主要看它。pTM 是单个标量对标 TM-score用来评估整体结构域的打包是否可信。这段动图来自 CASP14 竞赛左侧 RNA 聚合酶结构域 GDT 90.7右侧粘附素尖端结构域 GDT 93.3可以看出预测结果蓝与实验结构绿的贴合程度。排障与调优六个常见卡点现象一容器里nvidia-smi看不到 GPU。原因NVIDIA Container Toolkit 未安装或未正确配置。 解法先在宿主机跑docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi做隔离验证仍不可见就重装 Toolkit 并检查 Docker 守护进程配置。现象二Docker 镜像构建异常慢。原因下载目录是仓库的子目录大数据库被拷进了构建上下文。 解法把数据目录挪到仓库外再重新构建。现象三MSA 阶段抛出莫名其妙的报错。原因数据目录读写权限不足。 解法给数据目录及其子目录授予足够权限例如chmod 755 -R DOWNLOAD_DIR再重跑。现象四大蛋白跑不完或 OOM。原因推理时长随链长增长很快4000 残基在 A100 上超过 1.5 小时显存同样有上限。 解法先确认 GPU 显存余量超长序列可考虑按结构域拆分预测reduced_dbs能省掉 MSA 阶段的大部分等待。现象五同一条序列两次跑出不同结果。原因模型本身存在跨运行的随机方差近期新沉积序列多的靶点比如 CASP14 的 T1064尤其明显。 解法这是预期行为而非故障默认的 5 模型集成就是在对冲它需要复现特定结果时固定数据库版本和--max_template_date。现象六换了参数想快速试错每次都从头跑。原因MSA 检索占了大头。 解法加--use_precomputed_msastrue复用首次运行算好的 MSA前提是序列不变且输出目录结构还在。延伸方向复合物预测AlphaFold-Multimer 需要额外下载 UniProt 和 pdb_seqres 两个库默认每个复合物跑 25 次预测时间紧张可把--num_multimer_predictions_per_model设为 1用少量精度换速度技术细节v2.3.0 的模型架构与推理流程见技术笔记仓库还附带一套完整的 CASP15 基线预测可作对照轻量体验不想搭完整环境时可以先用 Colab 简化版 notebook 跑通流程熟悉输入输出后再上完整管线许可方面提醒一句代码是 Apache 2.0模型参数是 CC BY 4.0发表结果时记得引用 AlphaFold 原文用了 multimer 的话把对应论文也加上。接下来该做什么核对机器是否达标Linux NVIDIA GPU 600 GB精简或 2.6 TB完整的 SSD 空间装好 Docker、NVIDIA Container Toolkit、aria2c克隆仓库数据目录放在仓库外后台启动下载脚本构建镜像后先用 nvidia-smi 验证 GPU选一个 200 残基左右的短蛋白用monomerreduced_dbs跑第一次预测拿到结果后重点看ranked_0.pdb的 pLDDT 分布能读懂置信度之后再挑战复合物和大蛋白能独立判读一次预测输出这套工具就算入门了——剩下的功夫都在你打算用这个结构做什么研究上。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考