资讯详情

P/D-Device: Disaggregated Large Language Model between Cloud and Devices

📅 2026/9/27 10:28:02 | 华诺云谱 👁 阅读
P/D-Device: Disaggregated Large Language Model between Cloud and Devices
P/D-Device:云与设备间的解耦大语言模型研究总结与翻译一、文章主要内容本文聚焦大语言模型(LLM)在云-设备协同部署中的资源瓶颈问题,提出了名为P/D-Device的云-设备解耦协作方案,旨在同时解决云端资源长期占用导致吞吐量低、设备端资源有限导致首 token 延迟(TTFT)高的核心痛点,具体内容如下:1. 核心问题诊断云端瓶颈:LLM 解码阶段需生成大量 token,采用自回归生成方式,单请求占用解码实例时间长(如生成100个token需3秒,长文本任务甚至达数十秒),即使配备大量 NPU/GPU,吞吐量(TPS)仍受限于请求平均延迟。设备端瓶颈:设备端资源(计算、内存)有限,预填充阶段(compute-bound 阶段)的 TTFT 随提示词长度激增(如8k token 输入需数十秒),且无法维持 LLM 常驻实例;虽有滑动窗口注意力、量化等轻量化技术,但仍难以平衡延迟与性能。协同挑战:云-设备间传输中间数据(如 KVCache,常达 GB 级)面临实时性与数据量矛盾;现有推测性推理等协同方案需频繁通信,易受网络抖动影响,且未考虑长上下文场景下设备端预填充效率。2. P/D-Device 方案设计方案核心是仅在设备端预填充阶段让云端提供部分协助
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑