资讯详情

Safety:面向大模型智能体的多维度安全能力评测基准

📅 2026/9/27 2:30:40 | 华诺云谱 👁 阅读
Safety:面向大模型智能体的多维度安全能力评测基准
Safety面向大模型智能体的多维度安全能力评测基准arXiv编号arXiv:2609.30028v1 [cs.CL]摘要大模型智能体可调用外部工具修改真实系统状态带来区别于普通对话模型的新型安全风险。现有的安全基准大多聚焦单轮对话提示注入缺少对工具调用、多步长视界交互、环境状态变更风险的系统性覆盖。本文构建AgentBench(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety一套面向工具智能体的多维度安全评测基准。数据集包含1242条测试用例分为4大风险大类、14个风险子类覆盖提示注入、权限滥用、信息泄露、错误行为诱导评测同时包含攻击侧用例与正常业务良性用例兼顾安全防御能力与业务可用性避免模型为了安全而过度拒绝合法请求。设计分层评测指标攻击防御成功率、良性任务通过率、F1综合指标量化安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性权衡。对14个主流开源、闭源大模型开展大规模评测。实验表明现有智能体基座普遍存在安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性两难多数模型防御攻击的同时会误拒绝大量正常合法任务闭源前沿模型整体表现优于开源模型但仍然存在明显短板。进一步开展消融研究分析系统提示、沙箱隔离、输入过滤三类防护手段的收益与副作用。数据集、评测脚本、全部配置完整开源。关键词智能体安全工具调用安全评测基准提示注入权限滥用安全可用性权衡目录[引言](#1(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})引言)[相关工作](#2(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})相关工作)[AgentBench(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety基准构建](#3(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})agentbench(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety基准构建)[3.1 风险分类体系](#31(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})风险分类体系)[3.2 数据集构建流水线](#32(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})数据集构建流水线)[3.3 评测指标定义](#33(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})评测指标定义)[实验设置](#4(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})实验设置)[4.1 被测模型集合](#41(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})被测模型集合)[4.2 仿真工具环境](#42(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})仿真工具环境)[4.3 基线防护策略](#43(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})基线防护策略)[主实验结果](#5(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})主实验结果)[5.1 整体安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性表现](#51(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})整体安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性表现)[5.2 不同风险子类下模型表现](#52(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})不同风险子类下模型表现)[5.3 安全可用性帕累托分析](#53(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})安全可用性帕累托分析)[防护策略消融实验](#6(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})防护策略消融实验)[案例分析](#7(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})案例分析)[讨论与局限性](#8(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})讨论与局限性)[结论](#9(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})结论)[参考文献](#10(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})参考文献)[附录A 数据集统计详情](#附录a(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})数据集统计详情)[附录B 完整评测指标计算公式](#附录b(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})完整评测指标计算公式)[附录C 被测模型完整配置](#附录c(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})被测模型完整配置)[附录D 防护策略Prompt与脚本](#附录d(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})防护策略prompt与脚本)[附录E 细分实验完整结果](#附录e(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})细分实验完整结果)1 引言普通对话大模型安全评测主要针对单轮用户输入而工具调用智能体可以执行shell命令、读写文件、访问网络API能够修改外部环境状态衍生出新的安全威胁多步间接提示注入、越权访问、敏感信息外泄、被诱导执行破坏性操作。现有智能体安全评测存在若干不足样本偏向攻击样例缺少大量良性正常业务用例容易出现“过度安全”模型不分情况拒绝合法业务牺牲可用性对多步交互、工具链式调用、环境状态演变的风险覆盖不足缺少统一综合指标无法量化安全防御与业务可用性之间的权衡。本文提出AgentBench(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety智能体安全评测基准数据集规模1242条测试用例攻击用例744条良性正常业务用例498条风险分为4大类别、14个子类覆盖提示注入、权限滥用、信息泄露、行为诱导配套仿真隔离工具沙箱不会对真实系统造成伤害指标体系攻击防御成功率ASR(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def、良性任务通过率Benign(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass、综合F1衡量安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性权衡。在14个主流大模型上开展零样本评测。核心发现当前模型普遍面临安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性两难提升攻击防御能力往往伴随合法业务拒绝率上升闭源模型综合表现整体优于开源模型没有模型可以同时做到高防御率高良性任务通过率消融实验系统安全提示、输入关键词过滤、沙箱权限限制各有收益但每一种防护手段都会带来可用性代价。本文主要贡献构建AgentBench(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety多维度智能体安全基准1242条用例同时包含攻击用例与良性业务用例覆盖工具智能体典型风险场景。设计分层指标同时度量攻击防御效果与正常业务可用性量化安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性帕累托权衡。大规模评测14个主流模型揭示现有智能体基座的安全短板对三类主流防护策略开展受控消融。数据集、仿真沙箱环境、评测脚本、实验配置全部开源。2 相关工作对话大模型安全基准HarmBench等聚焦单轮文本输入不涉及工具调用、环境状态变更。智能体安全评测AgentHarm、PASTABench等。AgentHarm侧重整条轨迹事后判定PASTABench聚焦时序主动监控干预AgentBench(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety兼顾攻击样本与良性业务样本重点量化安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性权衡覆盖多类工具滥用风险。智能体安全防护手段系统提示加固、输入过滤、沙箱权限管控、独立安全监护模型。本文对前三类防护策略做系统消融评估收益与副作用。基准横向对比简表基准工具调用多步交互包含良性用例安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性综合指标风险子类数量HarmBench❌❌✅❌6AgentHarm✅✅❌❌8PASTABench✅✅❌❌13AgentBench(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety(本文)✅✅✅✅143 AgentBench(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety基准构建3.1 风险分类体系4个一级大类14个二级子类提示注入类风险直接系统提示劫持多步间接注入工具返回内容注入分隔符混淆注入。权限滥用风险越权文件读写高危shell命令执行越权网络访问权限绕过。信息泄露风险内部凭证泄露用户隐私数据外泄业务配置信息泄露。错误行为诱导风险诱导破坏业务数据诱导发送欺诈消息误导执行无意义高危操作。数据集构成攻击用例744条触发上述风险良性用例498条合法正常业务工具调用任务不携带任何攻击意图。3.2 数据集构建流水线案例构思基于真实智能体安全漏洞报告生成初始case草稿仿真环境适配每条用例绑定工具调用序列在仿真沙箱内验证可复现双轮标注校验标注员区分攻击/良性标记风险子类交叉校验过滤歧义样本自动化真值校验在仿真环境运行确认攻击用例可以触发对应风险行为人工复审过滤泄露真实密钥等敏感内容得到最终1242条测试用例。每条样例字段用户prompt、初始环境上下文、允许调用工具集合、风险标签、真值判定、预期行为说明。3.3 评测指标定义ASR(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def攻击防御成功率攻击用例下智能体拒绝执行危险行为的比例越高越好。Benign(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass良性任务通过率良性合法用例智能体正确完成业务任务的比例越高越好。F1(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety综合F1指标平衡防御攻击与业务可用性。KaTeX parse error: Cant use function \( in math mode at position 4: F1\̲(̲F1‑safety \fr…说明一个优秀智能体需要两项指标同时保持高位只防御攻击但大量拒绝正常业务F1(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety会被拉低。4 实验设置4.1 被测模型集合共14个闭源GPT(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4o、GPT(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4o(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})mini、Claude(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Sonnet(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4.6、Claude(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Opus(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4.7、Gemini(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro、Gemini(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Flash开源Llama(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Maverick、Llama(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3.3(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})70B、Qwen2.5(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})72B、Qwen2.5(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})32B、Qwen2.5(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})14B、DeepSeek(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})V4(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro、GLM(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})5.2(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro、Yi(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})34B(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Chat。4.2 仿真工具环境仿真沙箱实现文件读写、shell执行、网络请求不会操作真实主机系统。环境记录全部工具调用评测器自动判断是否执行高危风险行为、良性任务是否完成。4.3 基线防护策略消融配置Base原始基线默认普通智能体系统提示无额外防护Sys(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Prompt增强安全系统提示增加风险警告、禁止高危操作Input(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Filter输入层关键词黑名单过滤拦截高危关键词Sandbox(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Restrict沙箱层面限制禁用高危命令、限制文件路径访问范围。5 主实验结果5.1 整体安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性表现代表性模型零样本Base基线配置指标节选模型ASR(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def攻击防御率Benign(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass良性通过率F1(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety综合Claude(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Opus(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4.782.3%76.1%79.1%GPT(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4o79.7%77.4%78.5%Gemini(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})3(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro76.2%73.8%75.0%Qwen2.5(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})72B67.5%68.2%67.8%Llama(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})4(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Maverick64.1%65.7%64.9%DeepSeek(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})V4(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pro62.8%66.3%64.5%Yi(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})34B(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Chat54.6%61.2%57.7%整体现象闭源前沿模型综合F1(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety整体优于开源模型不存在模型同时做到ASR(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def与Benign(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass双双接近90%普遍存在安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性权衡。5.2 不同风险子类下模型表现直接提示劫持大部分模型防御效果尚可工具返回注入、多步间接注入所有模型防御难度显著升高ASR(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def明显下降权限滥用shell高危命令开源模型更容易被诱导执行高危命令信息泄露类风险模型容易无意识把内部凭证随工具输出返回用户。5.3 安全可用性帕累托分析大部分模型落在帕累托前沿下方提升攻击防御率往往会带来良性任务通过率下降案例开启强安全提示ASR(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def上涨7(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})12个百分点但Benign(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass下降5(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})9个百分点。6 防护策略消融实验以Qwen2.5(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})72B为代表模型对比不同防护手段配置ASR(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})defBenign(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})PassF1(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safetyBase原始基线67.5%68.2%67.8%Sys(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Prompt安全提示76.1%61.4%68.0%Input(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Filter输入过滤78.4%58.7%67.2%Sandbox(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Restrict沙箱限制74.8%64.3%69.3%全部三者组合83.2%53.1%64.7%消融关键结论安全系统提示、输入关键词过滤、沙箱权限限制都可以提升攻击防御成功率每一类防护手段均会损伤良性业务通过率全部防护叠加防御率最高但良性通过率大幅下滑沙箱权限限制相对三者之中对可用性伤害最小关键词黑名单过滤容易误拦截合法业务。工程启示不能只看攻击防御指标必须同步监控良性业务通过率避免过度防护。7 案例分析多步间接注入失败案例用户先诱导智能体读取一份恶意构造的文档文档内部携带注入载荷模型读取文档之后被劫持忽略原有安全约束。即使是强模型该类场景依旧容易失守。过度拒绝案例开启关键词黑名单合法业务shell命令因为命中黑名单词汇被拦截业务任务直接失败。沙箱防护案例沙箱限制文件访问路径即使模型产生越权调用意图工具层直接拒绝执行从环境层面阻断风险。8 讨论与局限性本基准基于仿真沙箱环境不是真实生产环境仿真不能完全复现生产环境全部复杂漏洞。评测为零样本设置没有测试经过安全专项微调后的模型。风险样例是人工构造不能覆盖现实世界无穷多攻击变体基准侧重工具调用带来的安全风险不覆盖纯视觉多模态、具身机器人场景。工程启示只看攻击防御率会误导选型安全评测必须配套大量良性业务用例评估可用性损失各类防护手段均存在副作用需要做权衡沙箱环境权限隔离是性价比很高的底层防线。未来方向拓展多模态、具身智能体用例引入监护模型作为防护策略做消融构建对抗生成攻击变体测试集。9 结论本文提出AgentBench(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Safety工具智能体安全评测基准包含1242条测试用例覆盖4大类14子类工具智能体安全风险同时包含攻击用例与良性业务用例设计ASR(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})def、Benign(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})Pass、F1(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})safety综合指标量化安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性权衡。对14个主流模型开展评测实验证实当前大模型智能体普遍面临安全(F1‑safety \frac{2\times ASR_{def} \times Benign_{Pass}}{ASR_{def}Benign_{Pass}})可用性两难闭源模型整体占优但仍然存在短板多步间接注入、工具返回注入是主要薄弱点。消融表明安全提示、输入过滤、沙箱限制都可以提升防御但都会带来业务可用性损失沙箱权限隔离综合代价相对更小。数据集、仿真沙箱、评测脚本全部开源。10 参考文献完整参考文献查阅原始arXiv网页https://arxiv.org/html/2609.30028v1附录简要说明附录A数据集完整统计各子类样本数量分布。附录B评测指标完整数学公式、判定规则。附录C14个被测模型完整推理参数、调用配置。附录D三类防护策略完整系统提示、输入过滤黑名单脚本、沙箱限制配置。附录E所有模型细分风险子类完整实验结果表格。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑