资讯详情

EASER:面向多目标多肽设计的证据感知反思式智能体——弥合证据到执行的鸿沟

📅 2026/10/9 12:40:33 | 华诺云谱 👁 阅读
EASER:面向多目标多肽设计的证据感知反思式智能体——弥合证据到执行的鸿沟
EASER面向多目标多肽设计的证据感知反思式智能体——弥合证据到执行的鸿沟原文网页https://arxiv.org/html/2610.06190v1PDF链接https://arxiv.org/pdf/2610.06190v1arXiv编号arXiv:2610.06190v1 [cs.AI]摘要大语言模型可以对科学文献开展推理并制定复杂设计策略但很难将策略转化为可靠的生物序列操作。蛋白质语言模型及其生成器能够学习复杂序列模式但本身不具备将文献证据融入多步推理与反思决策的能力。这种割裂造成了证据‑执行鸿沟科学推理无法落地为序列层面的可控操作。本文提出**EASEREvidence‑Aware Sequence Engineering with Reflection带反思的证据感知序列工程**反思式智能体通过可学习的属性接口打通科学推理与序列生成。该接口包含离线训练、搜索阶段保持固定的面向不同属性的低秩矩阵智能体组合这些矩阵来引导专用扩散生成器。智能体利用检索得到的生物学证据、序列上下文与历史结果提出干预假设指定锚定序列、可编辑位置与控制系数通过「探测‑引导Probe‑and‑Steer」机制对干预方案开展测试依据预测的属性响应分配后续采样量并且对输出结果做反思指导后续决策。本文在计算抗菌肽AMP设计任务上开展评测需要同时平衡抗菌活性、非溶血、无毒性多重目标。在相同决策条件下显式假设推导相比直接动作生成能够带来更大的多目标收益。消融实验验证证据检索、情景历史记忆、反思机制、探测‑引导模块的贡献。六组独立重复实验表明在筛选后的候选样本上EASER取得被测搜索策略与生成器中最高平均超体积HV、最低平均IGD指标。抗菌肽实验证明可执行属性接口与迭代反馈可以将科学文献推理与专用序列生成器有效结合。关键词多肽设计抗菌肽多目标优化科学智能体扩散生成模型低秩控制证据‑执行鸿沟反思式智能体目录引言相关工作方法EASER智能体框架3.1 低秩输出层干预控制3.2 基于证据的干预假设生成与Probe‑and‑Steer探测‑引导机制3.3 属性方向矩阵离线学习流程实验设置实验结果5.1 多目标抗菌肽设计整体性能5.2 智能体决策对搜索帕累托前沿的塑造作用5.3 可学习控制带来的耦合属性响应5.4 向细胞穿透多肽任务轻量化迁移讨论与结论参考文献附录简要说明1 引言科学文献会给出生物序列设计的干预原则指明氨基酸修改操作以及生效条件。例如残基替换可以同时改变抗菌活性与溶血水平。大语言模型可以对这类原则做推理但文本形式的规划并不能可靠产出具备预期属性的序列序列生成模型能够学习复杂模式但不会解读文献证据、挑选干预手段、对结果做反思复盘。本文将该现象定义为证据‑执行鸿沟evidence‑to‑execution gap科学证据难以转化为可执行的序列干预操作。抗菌肽AMP设计是该鸿沟的典型场景需要平衡抗菌活性、非溶血、低毒性疏水性改变会对活性、溶血产生不同影响。应用文献原则需要针对具体序列做决策并评估多目标共同作用结果。现有方案包含文本‑序列配对学习、奖励优化、工具智能体等路线。ProteinDT对齐文本与蛋白表征ProtDAT基于蛋白描述做条件生成奖励偏好方法指定期望输出ProtoCycle将反思规划与工具反馈结合。本文提出EASER反思式智能体在冻结的多肽扩散生成器之上构建可组合控制接口离线学习面向属性的低秩矩阵搜索阶段矩阵保持固定智能体组合矩阵系数同时选择锚定序列、可编辑位置证据指导智能体何时、在何处施加这些控制。由于不同控制之间会互相影响智能体将干预作为可检验的假设Probe‑and‑Steer机制先小批量测试干预依据联合预测属性响应分配后续采样量反思环节将动作与结果关联指导后续决策。整个搜索过程中扩散生成器与低秩矩阵保持冻结智能体仅调整系数、锚点、编辑掩码。本文主要贡献提出一套可执行的可组合低秩属性控制接口实现对多肽扩散生成器的定向调控。构建基于证据的反思式智能体通过Probe‑and‑Steer探测‑引导机制检验干预假设。在抗菌肽多目标设计任务完成实证通过组件消融、耦合响应分析验证各模块有效性该接口可以轻量化迁移到细胞穿透多肽CPP任务。2 相关工作2.1 多肽生成模型AMPGAN v2、AMPGPT2基于对抗、自回归生成Prot‑Diff、AMPGen使用扩散模型AMP‑Designer结合提示调优与强化学习HMAMP、MOFormer依靠超体积优化、帕累托排序处理多目标。EASER重点关注智能体决策流程利用领域证据、搜索历史选择干预并根据观测结果修订决策。2.2 可控生成技术偏好优化从配对样本学习DRAKES、ProteinDPO结合奖励与散度正则TR2‑D2、token对齐偏好优化学习属性条件偏好分类器引导/无分类器引导调控扩散采样PepTune、MP2D引入多目标树搜索LoRA、模型拼盘实现模型轻量化适配。上述方法大多通过奖励、标签、条件输入表达目标EASER的特点是把文献残基‑属性证据映射到锚定序列、编辑位置、属性矩阵系数这一套可执行决策。2.3 科学智能体ReAct、Reflexion实现推理‑动作‑文本反馈范式ChemCrow、Coscientist将大模型连接化学工具SciToolAgent利用知识图谱做工作流选择ProtAgents、OSDA Agent、Virtual Lab处理蛋白相关科学任务。多肽领域PepCraft、Pepti‑Agent实现生成、预测、突变反馈ProtoCycle结合反思规划、支架检索、位点设计MAC‑AMP依靠多智能体评估配合PPO更新生成器。EASER与上述工作区别生成器全程冻结智能体只操作预训练得到的属性控制矩阵通过假设检验方式评估干预带来的多目标耦合效应。3 方法EASER智能体框架EASER在固定总采样预算下搜索活性‑安全权衡更优的多肽。智能体结合文献证据与历史结果选择锚定序列、可编辑位置、各属性控制系数观测输出属性响应再指导后续采样。3.1 低秩输出层干预控制本文基于DPLM扩散蛋白语言模型在短肽、AMP语料上做LoRA适配搜索阶段模型权重完全冻结。对于位置i ii、去噪步t tt的上下文隐状态h i , t ∈ R d h_{i,t}\in\mathbb R^dhi,t​∈Rd基础输出logits为W 0 h i , t b W_0 h_{i,t}bW0​hi,t​b。针对三类目标属性活性(a)、非溶血(h)、无毒性(t)分别学习低秩更新矩阵Δ W k U k V k ⊤ , U k ∈ R v × r , V k ∈ R d × r \Delta W_{k}U_{k}V_{k}^{\top },\ U_{k}\in \mathbb R^{v\times r},\ V_{k}\in \mathbb R^{d\times r}ΔWk​Uk​Vk⊤​,Uk​∈Rv×r,Vk​∈Rd×r本工作KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲v33\)KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲d1280\)秩KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲r16\)三套矩阵总参数量仅63024。搜索阶段矩阵保持固定智能体使用有界系数α k \alpha_kαk​做加权组合W e f f W 0 ∑ k α k Δ W k , ℓ i , t W e f f h i , t b W_{eff}W_{0}\sum _{k}\alpha _{k}\Delta W_{k},\quad \ell _{i, t}W_{eff} h_{i, t}bWeff​W0​k∑​αk​ΔWk​,ℓi,t​Weff​hi,t​b系数置0等价使用原始基础投影层。支持两种采样模式从头生成de‑novo全部位置均可编辑锚定优化anchored refinement指定锚定序列掩码固定部分残基仅修改可编辑区域。完整离线训练目标、数据、范数校准策略见附录B。3.2 基于证据的干预假设生成与Probe‑and‑Steer探测‑引导机制证据获取与专家模块序列条件检索获取物种、残基、基序相关文献证据交由活性、溶血、毒性三位属性专家模块确定性聚合支持证据、风险、置信度。大模型结合候选序列、属性预测得分、专家建议、历史结果生成可检验干预假设。每条假设包含锚定序列、可编辑位置集合、各属性控制系数、作用强度η \etaη同时写明预期收益与潜在风险。空锚集合代表完全从头采样。Probe‑and‑Steer探测‑引导探测Probe对每一条生成的干预假设各生成16条候选多肽获得联合属性预测响应。引导Steer基于探测得到的响应结果分配160个采样配额给到不同干预方案额外生成32条无引导从头采样样本引入新候选。单轮合计产出256条候选序列。反思与记忆更新本轮结束智能体总结各干预方案成功/失败经验更新档案库、情景记忆档案库中保留多样性帕累托候选作为下一轮迭代的锚定序列。完整伪代码见附录C Algorithm1。3.3 属性方向矩阵离线学习流程离线阶段使用配对多肽样本训练矩阵样本对由理化描述匹配分为偏好样本、非偏好样本活性使用MIC指标非溶血使用HC50毒性使用人工整理标签。使用参考掩码偏好损失函数结合扩散加噪重放、范数正则训练低秩因子根据验证集选择checkpoint完成范数校准后交付搜索阶段使用。4 实验设置对比生成器基线AMPGAN、AMPGPT2、AMPGen、AMPDesigner、AMP‑adapted DPLM。搜索策略对比使用同一套冻结生成器与矩阵固定系数、随机动作、LinUCB、NSGA‑II。任务抗菌肽AMP多目标优化同时优化活性、非溶血、无毒性序列长度15‑35氨基酸每方法每轮256候选共10轮每方法6组独立种子重复。评价指标超体积HV、修正反向世代距离IGD筛选条件三项调整后效用得分均大于0.5内部预测器用于智能体反馈外部预测器用于最终评测智能体无法访问外部评测结果。消融实验组移除证据检索、移除反思反馈、移除Probe‑and‑Steer、替换为随机矩阵控制、移除历史记忆与锚点复用。迁移测试细胞穿透多肽CPP任务复用冻结AMP主干仅重新学习一套秩16的CPP属性矩阵。5 实验结果5.1 多目标抗菌肽设计整体性能表各生成器筛选后帕累托前沿指标6种子均值±样本标准差方法通过筛选样本数HV超体积IGD反向世代距离AMPGAN11000.0362 ± 0.00440.0543 ± 0.0182AMPGPT217170.0330 ± 0.00260.0603 ± 0.0090AMPGen3950.0301 ± 0.00650.0739 ± 0.0307AMPDesigner14090.0356 ± 0.00410.0519 ± 0.0106AMP‑adapted DPLM5600.0350 ± 0.00420.0518 ± 0.0131EASER(本文)19470.0450 ± 0.00860.0277 ± 0.0177EASER取得最高平均HV0.0450最低IGD单属性top‑10指标非溶血得分最优活性指标仅次于AMPGPT2毒性与其它基线持平。5.2 智能体决策对搜索帕累托前沿的塑造作用表固定生成器与控制矩阵不同搜索策略对比6种子搜索策略HV超体积IGD反向世代距离Fixed coefficients 固定系数0.0282 ± 0.00760.0781 ± 0.0329Random actions 随机动作0.0389 ± 0.00680.0414 ± 0.0162LinUCB0.0373 ± 0.00870.0540 ± 0.0260NSGA‑II0.0344 ± 0.00690.0588 ± 0.0240EASER0.0450 ± 0.00860.0277 ± 0.0177在生成器、控制矩阵完全相同条件下EASER依旧显著优于强化学习、进化算法搜索基线。匹配信息对照实验同样输入证据、历史信息对比「显式写出假设写明预期效果与风险」vs「直接生成动作」。显式假设带来每状态平均HV增益从0.001510提升至0.002447筛选得到候选从162提升到261。关键消融结果3种子配对实验实验条件HVIGD通过样本EASER完整系统0.0439 ± 0.01170.0310 ± 0.0265871移除记忆与锚点复用0.0350 ± 0.00840.0558 ± 0.0267524移除证据检索0.0359 ± 0.00800.0544 ± 0.0321867移除Probe‑and‑Steer探测‑引导0.0293 ± 0.00650.0692 ± 0.02991089全部替换为随机矩阵控制0.0345 ± 0.00250.0499 ± 0.01281076Probe‑and‑Steer模块对HV指标影响最大下降33.2%证据检索、记忆复用同样带来可观收益把学习得到矩阵替换为同谱随机矩阵性能显著下跌证明离线学习的属性控制矩阵具备实际价值。5.3 可学习控制带来的耦合属性响应正系数下每一套目标属性对应的矩阵均可显著抬升对应属性得分且优于同谱随机矩阵。多矩阵组合可以生成单矩阵扫描无法得到的多目标权衡组合。不同属性取得最优得分对应的系数设置并不一致证明多目标之间存在固有权衡。5.4 向细胞穿透多肽任务轻量化迁移复用冻结的AMP主干网络仅重新训练一套秩16的CPP低秩矩阵。正控制可以将CPP预测得分均值从0.4257提升至0.7067反转系数则抑制该属性每一轮仅训练单个低秩矩阵即可完成迁移验证该接口的可迁移能力。6 讨论与结论本文提出EASER利用离线学习得到的可组合低秩属性控制接口打通科学文献证据到生物序列生成的执行链路。离线学习得到的属性矩阵相比随机控制能够产生更强、更定向的属性改变显式干预假设、Probe‑and‑Steer探测‑引导机制可以检验多目标耦合效应反思记忆模块利用历史结果指导后续迭代在抗菌肽多目标设计任务EASER相比现有多肽生成基线取得更优帕累托前沿接口可以轻量化迁移到细胞穿透多肽任务。局限性实验全部基于模型预测指标开展评估尚未做湿实验生物学验证当前仅针对多肽序列未来可以拓展到更长蛋白序列、更多生物属性目标。7 参考文献完整参考文献查阅原始arXiv网页https://arxiv.org/html/2610.06190v1附录简要说明附录A评测指标定义、筛选条件、帕累托前沿参考设置。附录BDPLM模型适配、低秩矩阵训练目标、数据集、范数校准流程。附录C完整算法伪代码、证据资源定义、消融输入配置。附录D控制矩阵响应分析、残基偏好、系数网格扫描完整结果。附录E全部补充实验数据表、帕累托投影图、理化分布统计。附录F完整一轮运行实例轨迹记录。附录GCPP迁移实验细节与补充结果。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑