资讯详情

大模型安全之三十八:AI 中的 DoS 攻击:当“拒绝服务”变成“拒绝钱包”

📅 2026/10/3 12:04:16 | 华诺云谱 👁 阅读
大模型安全之三十八:AI 中的 DoS 攻击:当“拒绝服务”变成“拒绝钱包”
引言AI 时代的拒绝服务攻击已发生根本性范式转移。传统 DoS 攻击目标是“瘫痪基础设施”而 AI 特有的“钱包拒绝服务”Denial of Wallet攻击目标是“耗尽预算”。攻击者无需压垮服务器只需诱导模型生成最昂贵的输出或盗用 API 密钥大规模调用付费接口就能以极低成本造成毁灭性经济损失。OWASP 将此风险归类为LLM10无界消费Unbounded Consumption明确涵盖 DoS拒绝服务和 DoW拒绝钱包两种形态详情可以参考大模型安全之十:LLM无界消耗Unbounded Consumption-CSDN博客。一、为什么 AI 让 DoS 攻击“换了剧本”传统 DoS 攻击的逻辑很直接用海量流量塞满带宽或耗尽计算容量。但 AI 服务的计费模式彻底改写了这个等式。每次 API 调用都直接产生费用输入 token 和输出 token 的定价是不对称的——输出通常贵得多。GPT-4 Turbo 的输出定价约为输入的 3 倍Claude 3 Opus 更是达到 5 倍。攻击者只需精心构造 prompt 让模型生成尽可能长的响应就能在单一请求中制造几十甚至上百倍于普通请求的成本。更危险的是隐蔽性。基础设施监控显示一切正常延迟和可用性毫无异常只有账单会在月底暴露异常。Sysdig 威胁研究团队估算针对顶级模型的 LLMjacking 攻击每个被入侵账户的日成本可达46,000 美元极端情况下超过100,000 美元。二、真实发生的 AI DoS 攻击事件事件一Gemini API 密钥被盗48 小时烧掉 8.2 万美元这是目前公开报道中最典型的“钱包型 DoS”真实案例。2026 年 2 月一家墨西哥三人创业团队遭遇毁灭性打击。他们的 Google Cloud API 密钥被未知攻击者获取随后在2 月 11 日至 12 日的 48 小时内攻击者利用该密钥疯狂调用 Gemini 3 Pro 图像和文本接口。结果账单飙升至 82,314.44 美元而这家公司正常的月均支出仅为180 美元涨幅约455 倍。团队发现后立即删除泄露密钥、禁用 Gemini API、轮换所有凭证并启用 2FA但 Google 援引“共享责任模型”表示账户安全由用户负责暗示这笔费用可能仍需他们承担。团队负责人表示如果 Google 要求支付哪怕三分之一公司都会直接破产。根源在于 Google Cloud 的设计缺陷API 密钥默认设置为“Unrestricted”无限制一旦项目启用了 Gemini API旧密钥会自动获得访问权限用户不会收到任何显式警告。Truffle Security 的研究发现2,863 个公开暴露的 Google API 密钥已具备访问 Gemini 的能力。事件二Sysdig 追踪的“LLMjacking”攻击安全公司 Sysdig 的威胁研究团队追踪到系统性攻击攻击者利用窃取的云凭证在受害者 AWS Bedrock 账户上大规模运行 LLM 调用。Sysdig 将这种模式命名为“LLMjacking”估算每个被入侵账户的最高日成本可达46,000 美元。在一次真实入侵中攻击者从公开 S3 桶窃取凭证后在不到 10 分钟内获得管理员权限随后调用 Bedrock 上的 Claude、DeepSeek、Llama 等多个模型并尝试启动 p4d.24xlarge GPU 实例约23,600 美元/月用于资源滥用。攻击者甚至使用 LLM 生成的代码含塞尔维亚语注释和幻觉 AWS 账户 ID来自动化攻击流程进一步降低了攻击门槛。事件三企业未设限额单月 Claude 消耗 5 亿美元这是一个“无攻击者的 DoS”案例但机制完全相同。2026 年 5 月Axios 报道披露一家企业在短短一个月内在 Anthropic 的 Claude 服务上产生了5 亿美元的账单。原因并非外部攻击而是管理层在给员工开通账号权限时忘记设置使用额度上限。问题在“按 token 计费”与“全员无限制使用”的组合下迅速失控。工程师构建 agent 工作流或大规模代码生成时单人每月就能产生数百到数千美元的成本。Microsoft 随后削减了内部 Claude Code 许可证因为每位工程师的月均 AI 成本已升至500 至 2,000 美元Uber 则在 4 月就耗尽了 2026 年全年的 AI 预算。三、AI DoS 攻击的核心原理1. 成本不对称放大器AI 推理的成本结构有一个根本特征输出远比输入昂贵。攻击者的目标是让模型“说得多”而非“听得多”。一个几百 token 的输入如果成功诱导模型生成 32,000 token 的输出成本差异可达 50-100 倍。多会话并发可复合这种放大效应。2. 上下文窗口填充与多轮累积OWASP 的研究揭示了一个尤其隐蔽的攻击模式在 agentic 会话中攻击者或“正常用户”维持开放会话逐步注入内容使每一轮推理都需重新处理完整累积的上下文。每轮成本从第 1 轮的约 0.001 美元攀升到第 100 轮的约 0.50 美元增幅达 500 倍。没有任何单次请求触发速率限制因为每次都在预算内但跨多个并发或长寿命会话的聚合成本可达数百美元。3. 递归生成与 Agentic 放大当 AI 系统具有自主推理能力并将自身输出作为下一步输入时攻击者可构造递归 prompt 使系统进入生成循环。在 agentic 系统中一个请求可能级联为数十次 API 调用每次调用都生成最大长度响应。OWASP 将此描述为“递归上下文扩展”攻击者构造的输入迫使 LLM 反复扩展和处理上下文窗口。4. 检索增强推理成本攻击RA-ICA这是一种更隐蔽的攻击方式专门针对使用 RAG检索增强生成架构的 AI 系统。攻击者不需要入侵系统也不需要持有有效凭证。他们只需在 AI 信任的外部数据源——公开网页、知识库、博客、论坛——中植入一个“特制文档”。当 AI 为回答用户问题而检索到这个文档时文档内容会诱导模型进行不必要的额外工作生成更长响应、进行更多推理步骤、调用更多工具、或反复扩展上下文。WWW 2026 会议发表的论文《Inference Cost Attacks for Retrieval-Augmented Large Language Models》提出了CREEP 框架Computational Resource Exhaustion via External Poisoning利用 LLM agent 自动生成既语义相关又能诱导 token 消耗异常增长的恶意文档。实验结果显示RA-ICA 可将 token 消耗提升高达 13.12 倍成功率超过 90%且不降低生成答案的完整性。这种攻击的危险性在于完全不可见用户看到的回答是正确的只是更慢、更贵从可用性监控看服务完全正常从单次请求看成本可能只比正常高几倍不触发任何单请求预算告警。攻击者甚至可以一次污染多个系统——通过供应链或公共数据源。5. 微调管道滥用这是单项成本乘数最高的 AI DoS 攻击方式。微调端点通常接受用户上传的数据集然后启动一次昂贵的训练任务。与推理调用不同微调任务的成本是批量、一次性、且难以中断的。一旦训练开始计算资源就被锁定费用持续累积直到任务完成或被人为终止。攻击路径很直接向微调端点提交一个超大尺寸的数据集。在验证机制发现问题之前这次训练可能已经消耗了数千美元的计算资源。Sysdig 追踪的攻击者尝试启动 p4d.24xlarge GPU 实例并运行训练脚本就是这一攻击模式的真实体现。6. 凭证盗用与 LLMjacking这是当前最猖獗的攻击路径。攻击者通过钓鱼、数据泄露、漏洞利用或内部威胁获取 API 密钥或云凭证然后以受害者名义大量调用 LLM 服务。Google 威胁情报团队指出被盗的 AI 凭证正在地下市场形成繁荣的交易生态犯罪分子购买这些凭证来执行自己的任务或转售给其他犯罪组织。四、如何检测 AI DoS 攻击检测的核心挑战在于恶意请求和正常的高消费请求在内容层面难以区分。一个用户合法地要求生成详细报告和一个攻击者诱导模型生成最大长度输出发出的请求看起来可能完全一样。因此检测策略必须从“内容审查”转向“行为与成本模式分析”成本异常告警基于机器学习的成本异常检测是最有效的手段之一。正常使用模式下AI 服务的成本曲线相对稳定。攻击驱动的成本尖峰往往表现出异常特征短时间内成本急剧上升、与请求量不成比例的增长、或超出历史基线多个标准差。有用户报告 Google 的 Cost Anomaly Detection 确实捕捉到了异常但由于时差原因醒来时账单已从 975 美元飙升至 18,596 美元。Token 消耗速率监控单纯的请求频率限制不足以捕捉成本攻击。必须监控token 消耗速率而非请求速率关键指标包括每用户/每会话的累计 token 消耗、输出 token 与输入 token 的比率攻击者会推高这个比率、以及单位时间内的成本增长速率。递归循环检测对于 agentic AI 系统需要监控代理的“步数”和“回环次数”。当代理开始反复处理自己的输出、或在多个模型调用之间形成可预测的循环模式时应触发告警。OWASP 建议“限制排队动作的数量以及系统对 LLM 响应做出反应的总动作数”。会话级累积成本追踪单次请求可能完全在预算内但跨多轮对话的累积成本可能迅速失控。必须对会话级别的累积 token 消耗进行追踪和限制。五、预防与缓解框架有效的 AI DoS 防御遵循“纵深防御”原则——确保没有任何单一控制点的失效会导致无限的财务风险。以下五层框架与 OWASP 的推荐实践高度一致。第一层成本感知的速率限制传统速率限制每用户、每 IP、每时间窗口的请求数是必要的但远远不够。一个复杂的攻击者可以完全遵守请求频率限制同时持续发送高成本请求。速率限制必须是成本感知的不仅限制请求数量还要限制单位时间内的 token 消耗量或预估成本。F5 AI Gateway 支持基于 JWT 或 header 的身份感知路由可为不同用户组分配不同的访问级别和配额。第二层Token 预算强制执行在三个级别上设置硬性预算上限单次请求级别每个 API 调用分配最大 token 预算、会话级别限制多轮对话中的累计消耗、组织级别计费周期内的总支出硬上限。当任何预算耗尽时后续请求应被降级到更低成本的模型或直接拒绝。OWASP 明确推荐“为每个 API 调用强制执行最大输出 token 限制无论 prompt 要求什么”。第三层响应长度硬上限无论 prompt 如何构造应用层必须有一个不可绕过的输出长度上限。这确保即使最精心构造的 prompt 也无法生成超过上限的内容直接缓解上下文窗口填充攻击。第四层凭证卫生与最小权限避免硬编码凭证和 API 密钥对所有云凭证实施最小权限原则定期轮换密钥对疑似泄露的凭证立即撤销。Google Cloud 用户应特别检查 API 密钥的apiTargets限制避免“Unrestricted”默认设置导致的权限蔓延。TruffleHog 等开源工具可用于扫描代码、CI/CD 管道和 Web 资产中的泄露密钥。第五层断路器Circuit Breaker这是最后一道防线。当支出超过定义的紧急阈值时系统自动暂停非关键 AI 服务直到人工操作员调查并授权恢复。断路器的作用不是防止初始攻击而是限制攻击的最大财务损失。值得注意的是Google Cloud 目前缺乏项目级别的自动支出上限现有的预算警报只通知不阻止这意味着用户必须自行构建断路器机制。总结AI DoS 攻击标志着安全威胁从“可用性破坏”向“经济性破坏”的范式转移。攻击者不再需要庞大的僵尸网络或高超的入侵技术——他们只需要一把泄露的 API 密钥或者一个能最大化输出长度的 prompt就足以让一家小公司在 48 小时内面临破产让一家大企业在单月烧掉 5 亿美元。从 Gemini 密钥盗刷到 LLMjacking从 RA-ICA 到微调管道滥用这些真实事件和攻击技术共同指向一个结论AI 时代的成本控制不是事后审计而是必须在应用层实时执行的防御性架构。传统 DDoS 防护关注“流量入口”而 AI DoS 防御必须覆盖推理、检索、训练三个成本中心。没有多层成本护栏的 AI 部署本质上是在向任何拿到密钥的人签发一张空白支票。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑