资讯详情

生物大分子批量仿真开发教程(14):可开发性批量评估(二)——聚集、稳定性与免疫原性,多源分数合成统一风险表

📅 2026/9/15 9:25:55 | 华诺云谱 👁 阅读
生物大分子批量仿真开发教程(14):可开发性批量评估(二)——聚集、稳定性与免疫原性,多源分数合成统一风险表
生物大分子批量仿真开发教程14可开发性批量评估二——聚集、稳定性与免疫原性多源分数合成统一风险表版本声明块工具/软件TANGOtango.crg.esAGGRESCAN→Aggrescan3DA3D2/Aggrescan4DA4DCamSol/CamSol3.0TAPBioLuminateSAP 商业实现NetMHCIIpan-4.0TepiToolIEDB语言/环境Python 3.10 pandas服务器状态实测日期2026-09-04本文目标给第 13 篇的可开发性矩阵补上聚集、稳定性、免疫原性三条腿合成一张多源统一风险表一句话结论本篇的硬事实是服务器现状实测 2026-09-04铁律 8TANGO 在线https://tango.crg.es/但需注册许可AGGRESCAN 原站bioinf.uab.es已失效、后继 A3D2http://biocomp.chem.uw.edu.pl/A3D2/与 pH 依赖的 A4Dhttps://biocomp.chem.uw.edu.pl/a4d/在线CamSol 原剑桥服务器为维护页、只能本地安装Zyggregator 无维护入口SAP 的商业实现只在 BioLuminate——所以批量流水线必须带可用性探针 替代路径再把 TANGO/A3D/CamSol/TAP 分数、第 12 篇 MD 代理量与 NetMHCIIpan-4.0/TepiTool 免疫原性分按批次内百分位 一票否决 计数投票聚合成统一风险表用 AC-SINSLiu 2014 mAbsΔλmax等实验批次回归校准阈值。〇、本篇要解决的认知问题聚集预测工具谱系到 2026 年 9 月还能用哪些TANGO、AGGRESCAN、A3D/A4D、CamSol、Zyggregator、SAP 各自的现状与替代路径是什么序列级聚集热点TANGO/AGGRESCAN 系与结构级聚集倾向A3D/SFvCSP/SAP在方法论上差在哪为什么两条都要Tagg、Tm 这些实验热稳定量在 MD 侧有什么可用的代理量代理二字边界在哪免疫原性批量预测怎么做NetMHCIIpan-4.0 与 TepiTool 各占什么位置局限是什么多源分数量纲、方向、缺失率全不同怎么合成一张可审计的统一风险表实验对照AC-SINS/HIC/BVP-ELISA怎么进来校准一、机制解析1.1 聚集工具谱系与实测现状2026-09-04铁律 8引用在线工具不给实测日期等于埋雷。以下为系列基线日期的登记结果流水线代码必须内嵌同一张表见 2.1工具层级方法锚点现状实测 2026-09-04批量替代路径TANGO序列级 β-聚集成核Fernandez-Escamilla 2004 Nat Biotechnol 22:1302✅ https://tango.crg.es/ 在线需注册许可站内申请账号Web 服务限速条款遵守其页面AGGRESCAN序列级聚集热点Conchillo-Solé 2007 BMC Bioinformatics 8:65 原 bioinf.uab.es 失效、CSIC 镜像 404后继A3D2下行为准Aggrescan3DA3D2结构级折叠态结构遮蔽聚集热点✅ http://biocomp.chem.uw.edu.pl/A3D2/在线或按站点条款批量Aggrescan4DA4D结构级 pH 依赖NAR 2024 52:W170✅ https://biocomp.chem.uw.edu.pl/a4d/制剂 pH 敏感场景优先它CamSol序列级本征溶解度 突变优化Sormanni 2015 JMB 427:478DOI 10.1016/j.jmb.2014.09.0263.0 为 pH 版2023 原 mvsoftware 剑桥服务器为维护页本地安装许可条款以仓库为准集成进第 13 篇 run_tap 同款子进程模式Zyggregator序列级Tartaglia Vendruscolo 2008 Chem Soc Rev 37:1395 原服务器无维护入口仅作历史方法对比不进生产SAPspatial aggregation propensity结构级Chennamsetty 2009 PNAS 106:11937DOI 发表前复核商业实现于 BioLuminate开源近似 TAP 的 SFvCSP A3D 分数三条工程教训URL 是配置不是常量迁址改配置文件脚本不动许可状态进风险登记表TANGO 的注册许可意味着自动化提交要过合规不能偷偷爬原站 404是所有在线工具工具的默认预期——探针先行、失败降级到本地实现是流水线的常态分支而不是异常。1.2 序列级 vs 结构级遮蔽机制是全部差异的来源同一句序列TANGO/AGGRESCAN/CamSol 看到的是氨基酸内在倾向A3D/SAP/SFvCSP 看到的是折叠后还剩多少暴露在表面。一个埋在上表面的聚集六肽序列级打高分、结构级接近零一个界面残基在单体里埋藏、在二聚过渡态暴露——于是两层的分歧本身就是信号序列高分 结构低分 ≈ 可控两边都高 真热点序列低 结构高罕见多为构象特异斑块→ 交给第 12 篇 MD 看构象系综会不会路过它。统一风险表因此三层并列而不是只取其一。1.3 Tagg/Tm 与 MD 代理量实验侧的地面真值Tm熔解温度DSC/nanoDSF与Tagg聚集起始温度 nanoDSF 背散射通道色谱面板 HIC/SEC/CEX-IEX/SMAC 补疏水/体积/电荷维度。批量不可能全量做实验MD 侧可用的代理量经验法则不是铁律且各家 SOP 阈值不同第 12 篇输出的rmsd_last构象稳定、rg_drift展开趋势、sb_occ盐桥网络完整度加上斑块面积在系综内的 P95 分位把第 13 篇结构级指标从单构象扩展成构象分布。代理量与 Tagg/Tm 的关系是排序近似它们大概率能把最不稳的 5%“捞出来不能预测Tagg68.4 ℃”。风险表把 MD 代理列的置信度标为低/样本少正是为此。1.4 免疫原性MHC-II 呈递预测的两个层次T 细胞依赖的免疫原性主流 in silico 路径是肽段-MHC-II 结合预测NetMHCIIpan-4.0Reynisson 2020 J Proteome ResDOI 10.1021/acs.jproteome.9b00874单一 HLA-DR 等位基因的精配模型实测 2026-09-04 在线https://services.healthtech.dtu.dk/services/NetMHCIIpan-4.0/DTU 规则要求非商用/学术用途合规TepiToolPaul 2016 Curr Protoc ImmunolDOI 10.1002/cpim.12http://tools.iedb.org/tepitool/把多等位基因、多类 I/II 分子结果聚合成 population consensus 百分位的流水线——批量选人群覆盖度用 TepiTool 的 consensus单基因高置信复评用 NetMHCIIpan-4.0二者是互补而非替代。局限必须写进报告呈递 ≠ 实际 T 细胞应答链接表位显性、竞争、加工都不在模型内所以免疫原性列只做相对排序 高风险标记进风险表的权重低于聚集类指标示例权重见 2.2 配置。1.5 实验对照锚点计算排序不可自证需要实验批次回归AC-SINS亲和力捕获自相互作用纳米颗粒光谱读出 Δλmax 红移Liu 2014 mAbs 6:483DOI 10.4161/mabs.27431做自相互作用的批量金标准旁证HIC疏水作用色谱保留时间对斑块/疏水列BVP-ELISA生物素化 VP 抗原池与表面等离子共振对多反应性polyreactivity锚文献 Jain 2017 PNAS 114:944DOI 本轮未复核、正式引用前以出版方页面为准。校准方法攒一批 ≥30 个有实测值的变体算风险表综合分与 Δλmax 的 Spearman 相关阈值随相关结构调——不校准的阈值是装饰。二、完整代码与逐行剖析2.1 服务器可用性探针probe.py把铁律 8 变成每次运行的例行动作#!/usr/bin/env python# -*- coding: utf-8 -*-probe.py —— 上线前先问工具还活着吗状态写进风险表元数据不是写进人的记忆importdatetimeimporturllib.requestimportpandasaspd SERVERS{# URL 全部来自本系列素材登记表改址改这张配置表TANGO:https://tango.crg.es/,# 在线但需注册许可A3D2:http://biocomp.chem.uw.edu.pl/A3D2/,# AGGRESCAN 后继A4D:https://biocomp.chem.uw.edu.pl/a4d/,# pH 依赖版NetMHCIIpan:https://services.healthtech.dtu.dk/services/NetMHCIIpan-4.0/,TepiTool:http://tools.iedb.org/tepitool/,AGGRESCAN_old:http://bioinf.uab.es/,# 原站域名素材核实其已失效}# 预期不可达留作回归对照# CamSol 原剑桥服务器mvsoftware 系实测为维护页但其原始 URL 未在本系列素材中逐字核实# 故不进探针表——这正是探针清单已核实登记表的纪律宁缺毋假。生产路径本地安装。defprobe(url:str,timeout:float15.0)-dict:requrllib.request.Request(url,headers{User-Agent:devrisk-probe/1.0})# 带 UA 是公共服务器的基本礼貌部分站点把无 UA 请求直接 403会造成假下线误判try:withurllib.request.urlopen(req,timeouttimeout)asr:# 只 GET 首页探针不做提交return{url:url,ok:True,status:r.status}# 避免对限速服务造成负担exceptExceptionase:return{url:url,ok:False,status:type(e).__name__}# 异常类型入库# 区分 404/超时/TLS 三种死法defmain()-None:todaydatetime.date.today().isoformat()dfpd.DataFrame([{checked_on:today,**probe(u)}foruinSERVERS.values()])df[note]df.url.map(lambdau:{SERVERS[TANGO]:需注册许可后自动化提交,SERVERS[AGGRESCAN_old]:已知失效→用 A3D2}.get(u,))df.to_csv(fserver_status_{today}.csv,indexFalse)print(df.to_string(indexFalse))if__name____main__:main()# 基线预期2026-09-04 实测口径TANGO/A3D2/A4D/NetMHCIIpan/TepiTool 可达# AGGRESCAN_old 不可达——探针输出与预期不符时先修流水线再谈跑分2.2 统一风险表聚合器risk_table.py#!/usr/bin/env python# -*- coding: utf-8 -*-risk_table.py —— 第 13 篇矩阵 聚集/免疫原性列 MD 代理列 → 统一风险表含实验回归importpandasaspd METRICS[# 每列登记方向、权重、层级、置信度 —— 元数据行而非裸列名是审计的最小代价{col:TANGO_score,lower_better:True,w:1.0,layer:seq,conf:0.8},{col:A3D_score,lower_better:True,w:1.0,layer:struct,conf:0.8},{col:CamSol_score,lower_better:False,w:1.0,layer:seq,conf:0.8},{col:FvCSP,lower_better:True,w:0.8,layer:seq,conf:0.9},{col:SFvCSP,lower_better:True,w:0.8,layer:struct,conf:0.9},{col:md_rmsd_last,lower_better:True,w:0.5,layer:md,conf:0.4},{col:imm_pct,lower_better:False,w:0.4,layer:immuno,conf:0.5},]VETO_Q0.02# 一票否决线任一指标批次内最差 2%第 13 篇 1.4 同款规则跨篇同构PASS_Q0.50# 计数投票线EXPERIMENT{# 有实测批次时启用回归校准键实验名值对应应该相关的计算列AC-SINS_dlambda_max:A3D_score,# ΔλmaxLiu 2014对结构级聚集列HIC_retention:CamSol_score,}defpct(s:pd.Series,lower_better:bool)-pd.Series:rs.rank(pctTrue)# 百分位只在提交批次内做跨批次绝对分不可比第 13 篇returnriflower_betterelse1-r# 3.3 的同款坑方向统一成越大越安全再进合成defmain(dev_csv:str,md_csv:str,imm_csv:str,out:str)-None:dfpd.read_csv(dev_csv).set_index(variant)# 第 13 篇 A/B/C/D 分层表进这里dfdf.join(pd.read_csv(md_csv).set_index(job).rename(columns{rmsd_last:md_rmsd_last}),howleft)dfdf.join(pd.read_csv(imm_csv).set_index(variant),howleft)# imm_pctTepiTool# ↑ join 不上该变体没跑 MD/免疫评列留 NaN——缺测和测了很差在风险表里必须可区分铁律 10cols[mforminMETRICSifm[col]indf.columns]# 列白名单交集上游加列不污染投票df[n_metrics]df[[m[col]formincols]].notna().sum(1)df[veto]Falseweighted,votedpd.Series(0.0,indexdf.index),pd.Series(0,indexdf.index)formincols:rpct(df[m[col]].astype(float),m[lower_better])# NaN 保持 NaN不补 0veto_part(rVETO_Q).fillna(False)# 把缺测当差冤枉当好漏判df[veto]|veto_part# 缺测变体进复核队列而不是投票池voted(rPASS_Q).fillna(False).astype(int)weightedr.fillna(0.5)*m[w]*m[conf]# 缺列按中性 0.5降权是df[risk_score]weighted/sum(m[w]*m[conf]formincols)# 保守选择须与 n_metrics 同读df[votes_pass]voted df[risk_tier]Ddf.loc[~df[veto],risk_tier]Cdf.loc[(~df[veto])(df[votes_pass]5),risk_tier]Bdf.loc[(~df[veto])(df[votes_pass]6)(df[n_metrics]len(cols)),risk_tier]Aforexp_col,calc_colinEXPERIMENT.items():# 有实测列时做排序一致性校准ifexp_colindf.columns:# Spearman 手写免依赖twodf[[exp_col,calc_col]].dropna()iflen(two)10:# n10 的相关是噪声直接跳过atwo[exp_col].rank();btwo[calc_col].rank()rho((a-a.mean())*(b-b.mean())).sum()/(((a-a.mean())**2).sum().sqrt()*((b-b.mean())**2).sum().sqrt())df.attrs[fspearman_{exp_col}]round(float(rho),3)# ρ 写进表元数据# 报告页引用它|ρ| 不达标经验线 0.5就先调权重再扩大候选池——顺序不能反df.to_csv(out)print(df[risk_tier].value_counts())print(缺测复核队列,df[(df[n_metrics]len(cols))(df[risk_tier]!D)].shape[0])if__name____main__:main(dev_matrix_voted.csv,md_metrics.csv,immunogenicity.csv,risk_table.csv)imm_pct的生成把每个变体 FvFc 序列切成 15-mer 肽池窗口/步长为可配置项逐肽送 NetMHCIIpan-4.0 或本地版再按 TepiTool 思路聚合人群覆盖百分位——服务的输入输出文件格式以其页面与安装版 --help 为准本文不臆造字段名肽切分就是row[i:i15]的滑窗属于第 02 篇级别的基础操作。2.3 免疫原性肽池生成 提交护栏peptides.py#!/usr/bin/env python# -*- coding: utf-8 -*-peptides.py —— 序列→15-mer 肽池NetMHCIIpan/TepiTool 通用输入形态带提交护栏frompathlibimportPathimportpandasaspddefmake_peptide_pool(seq:str,length:int15,step:int1)-list:return[seq[i:ilength]foriinrange(0,len(seq)-length1,step)]# 15-mer 是 MHC-II 结合预测的通用肽长惯例step1 全覆盖但提交量 序列长批量前先想清楚defmain(csv_in:str,csv_out:str,chunk:int5000)-None:dfpd.read_csv(csv_in)withopen(csv_out,w,encodingutf-8)asfh:for_,rindf.iterrows():pepmake_peptide_pool(str(r[full_sequence]))forkinrange(0,len(pep),chunk):# 分块文件Web 服务都有单次/每日限额partf{csv_out}.part{k//chunk}# 分块失败只重传一块幂等思路同铁律 5withopen(part,w,encodingutf-8)aspf:forpinpep[k:kchunk]:pf.write(f{r[variant]}|{k}\t{p}\n)# 行首回标 variant结果回流时# 肽→变体的归属链必须在生成时就写死事后按序列反查会被重复肽咬死print(peptide chunks written for,len(df),variants)if__name____main__:main(dev_matrix_voted.csv,peptides.tsv)三、常见报错与排查脚本上周还能连 AGGRESCAN今天全批 404。现象即铁律 8 的现实版。根因原站失效不是故障而是终态。解法跑 2.1 探针→按登记表切 A3D2 路径→对历史批次标注数据源版本把探针失败流水线自动降级写进编排第 19 篇的重试分类。TANGO 结果迟迟拿不到/账号被限。根因服务器在线但需注册许可2026-09-04 实测且自动化爬取违反使用条款。解法走注册与批量接口谈判流水线里 TANGO 列允许缺测2.2 已按缺测中性化处理主投票不依赖单源。风险表里最差档全是没跑过 MD 的变体。根因把缺测按 0 分处理。解法按 2.2 的纪律——缺列不投票、n_metrics与risk_score永远同读缺测变体进复核队列而非淘汰队列。免疫原性两列互相矛盾NetMHCIIpan 低危、TepiTool consensus 高危。根因单等位基因模型 vs 人群覆盖百分位是两个问题。解法报告里分开陈述——“DRB1*04:01 呈递风险低但人群覆盖后的 consensus 偏高多等位基因贡献”权重设置2.2 里 imm 0.4×conf 0.5已经体现免疫列只做标记不做主刀。pH 换了A3D 分数不动、A4D 动了风险表结论打架。根因不同 pH 敏感度来自工具方法本身。解法制剂 pH 敏感候选一律以 A4D/CamSol3.0pH 版为准把 pH 写进列名A4D_score_pH5.2风格风险表按配方 pH 匹配列取数。四、动手练习探针回归可判定运行 2.1与基线预期比对。判定标准7 个 URL 全部有ok/status字段TANGO/A3D2/A4D/NetMHCIIpan/TepiTool 可达AGGRESCAN_old/CamSol_old 不可达——任何一格与预期不符先查网络出口再查工具。风险表完整性可判定用 100 变体含 15 个缺 CamSol、10 个缺 MD 列跑 2.2。判定标准A 层变体n_metrics必须等于指标总数A 层不允许缺测25 个缺测变体不得出现 vetoTrue缺测≠差。实验校准可判定取 ≥30 个有 AC-SINS Δλmax 实测的变体回灌EXPERIMENT。判定标准spearman_AC-SINS元数据被写出若 |ρ|0.3把 A3D 权重降半并记录调权日志——调权必须留痕这是对外报告的可信度底线。五、小结与下一篇预告本篇补齐了统一风险表的三条腿聚集TANGO/A3D/A4D/CamSol/SAP 谱系 2026-09-04 实测现状表、稳定性Tagg/Tm 地面真值与 MD 代理量的排序近似边界、免疫原性NetMHCIIpan-4.0 精配 TepiTool 人群共识并把第 13 篇的投票规则跨篇同构地延伸到多源分数合成——方向归一、批次内百分位、缺测中性化、一票否决、实验回归校准五步一步都不能省。双抗与 ADC 在这张表之上还有专属的界面与偶联风险第 15 篇《双抗与 ADC 的专项仿真》处理它们万条序列的漏斗预算与断点续跑在第 17 篇实战中验收第 18 篇把本篇风险表直接装进双抗流水线。本篇认知问题回显FAQQ12026-09-04 实测下各聚集预测服务器现状如何替代路径是什么ATANGOtango.crg.es在线但需注册许可AGGRESCAN 原站 bioinf.uab.es 失效、CSIC 镜像 404后继 A3D2biocomp.chem.uw.edu.pl/A3D2/与 pH 依赖的 A4Dbiocomp.chem.uw.edu.pl/a4d/在线CamSol 原剑桥服务器为维护页→只能本地安装Zyggregator 无维护入口仅作历史对比SAP 商业实现在 BioLuminate开源近似为 TAP 的 SFvCSP A3D。Q2序列级和结构级聚集预测差在哪为什么都要跑A序列级TANGO/AGGRESCAN 系/CamSol量氨基酸内在倾向结构级A3D/A4D/SAP/SFvCSP量折叠后的表面暴露——差异来源是埋藏遮蔽。两层分歧本身就是信号双高真热点序列高结构低可控序列低结构高构象特异交 MD 构象系综复核。Q3Tagg/Tm 与 MD 代理量是什么关系ATmDSC/nanoDSF 熔解温度与 TaggnanoDSF 背散射聚集起始温度是实验地面真值MD 代理量用轨迹分析指标 rmsd_last、rg_drift、盐桥占用率及斑块面积的系综 P95只能做最不稳 5% 排序的近似不能预测绝对温度值——风险表里该层置信度权重最低示例 0.5×0.4。Q4NetMHCIIpan-4.0 和 TepiTool 在批量免疫原性里各干什么ANetMHCIIpan-4.0Reynisson 2020实测 2026-09-04 在线于 DTU 服务站做单一 HLA-DR 等位基因的精配结合预测TepiToolPaul 2016tools.iedb.org/tepitool把多等位基因/类别结果聚成人群覆盖 consensus 百分位。批量用 consensus 保覆盖度重点分子用前者复评呈递≠应答免疫列只做标记权重 0.4、置信 0.5。Q5多源分数怎么合成统一风险表实验对照怎么用A五步——方向归一越安全越大、批次内百分位跨批不可比、缺测中性化 0.5 并单独记 n_metrics、一票否决 计数投票出 A/B/C/D 层、有 AC-SINS/HIC 实测列时对相应计算列做 Spearman 排序一致性校准n≥10 才做|ρ|0.5 先调权重再扩池调权留痕。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。