AlphaFold 蛋白质结构预测教程:用序列预测三维结构,附自部署避坑清单
AlphaFold 蛋白质结构预测教程用序列预测三维结构附自部署避坑清单【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold你手里有蛋白质的氨基酸序列但要做结合口袋分析或突变设计缺的是它的三维结构。AlphaFold 是 DeepMind 蛋白质结构预测模型的开源实现输入一个 FASTA 序列文件输出预测的三维结构。这篇文章以自部署为主线带你走通三件事选运行路径、跑第一次预测、看懂输出。选最轻量的入口Colab 还是自部署没有本地 GPU先试 Colab 笔记本仓库里的 notebooks/AlphaFold.ipynb 是官方提供的简化版笔记本可以直接在 Colab 打开运行不需要在本地准备任何环境。想先验证一条序列、看看输出长什么样走这条路最快。决定自部署先对照硬件清单完整版本只支持 LinuxDocker 环境并需要 NVIDIA GPU。官方给出的三档配置运行方式硬件要求适合场景Colab 笔记本无需本地 GPU单次预测、轻量体验reduced_dbs 预设8 核 CPU、8 GB 内存、600 GB 磁盘日常预测full_dbs 完整数据库3 TB 磁盘、建议 SSD、NVIDIA GPU高精度、大复合物预测完整数据库下载量 556 GB解压后 2.62 TB动手前先确认磁盘reduced 版本小得多运行命令里要加--db_presetreduced_dbs与之配套。官方参考配置是 12 vCPU、85 GB 内存、A100 GPU 的机器在该 A100 上 1000 残基的蛋白质结构预测约 96 秒不含 MSA 和模板搜索时间序列越长耗时按平方级增长4000 残基约 5660 秒。一句话结论尝鲜用 Colab认真跑就备一台 600 GB 空余磁盘的 Linux 机器走 reduced_dbs。跑第一次预测并看懂输出一条命令预测单条蛋白把序列写进 FASTA 文件第一行名称下面一行序列入口是docker/run_docker.pypython3 docker/run_docker.py --fasta_pathsseq.fasta --model_presetmonomer --db_presetreduced_dbs数据库目录和输出目录参数按 README 补全即可。蛋白复合物同理FASTA 里放多条序列--model_preset改成multimer但需要额外下载 UniProt 数据库。看输出从 ranked_0.pdb 和 pLDDT 入手输出目录里每个目标一个子目录关键文件有五份unrelaxed_model_*.pdb模型原始输出、relaxed_model_*.pdb经 Amber 力场修正局部几何后的版本、ranked_0.pdb到ranked_4.pdb按置信度排序ranked_0.pdb最优。重点是pLDDT预测局部距离差异测试0 到 100模型给每个氨基酸打一个置信度分越高越可靠。它写在输出 PDB 的 B-factor 字段里注意方向和常规 B-factor 相反——数值越高越好。用结构之前先看关键区域的 pLDDT如果整段都偏低这次预测就不可靠。上图是官方在 CASP14 评估中的表现两个目标的 GDT 分别为 90.7 和 93.3蓝色预测结构与绿色实验结构高度重合这就是可信预测的样子。官方明确输出是理论预测结果不用于临床用途。判断结构是否可用pLDDT 是第一标准。⚠️ 这几个坑先绕开只支持 Linux其他操作系统无法运行Windows 用户需要先准备虚拟机或远程服务器数据库目录别放进仓库内DOWNLOAD_DIR放在 AlphaFold 目录里会让 Docker 构建变慢整个大数据库会被拷进镜像构建上下文权限问题报的是模糊错误数据库目录缺少读写权限时MSA 工具会报难以定位的错先检查权限README 建议对下载目录chmod 755 -R个别目标多次运行有差异官方以 T1064 为例说明波动做法是跑 5 个模型按置信度取最优别用单次运行下结论multimer 默认 25 次预测每个模型 5 个种子共 5 个模型机器不够强就加--num_multimer_predictions_per_model1降到每模型 1 次一句话结论自部署出问题九成是环境而非模型——磁盘、权限、数据库位置按这个顺序排查。 下一步 3 件事在 Colab 里跑通一次单链预测练熟读ranked_0.pdb里的 pLDDT自部署git clone https://gitcode.com/GitHub_Trending/al/alphafold用scripts/download_all_data.sh DOWNLOAD_DIR reduced_dbs下载精简数据库目录放在仓库外用--model_presetmultimer预测一个蛋白复合物对比链间接触与置信度模型迭代细节可查 docs/technical_note_v2.3.0.md还有一个值得动手试的问题同一条序列反复换参数预测时开启--use_precomputed_msastrue复用 MSA 能省掉最耗时的序列检索你跑批量预测的话这一步实际省了多少时间【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考