资讯详情

Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving

📅 2026/10/2 13:41:48 | 华诺云谱 👁 阅读
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
文章主要内容总结本文针对Transformer架构的大型语言模型(LLMs)在长上下文推理中面临的计算与内存成本随序列长度增长的问题,以及后Transformer模型(如状态空间模型SSMs、线性注意力、循环神经网络RNNs)的兴起,提出了一种基于存内处理(PIM)的加速方案Pimba,以统一支持Transformer和后Transformer模型的高效服务。核心发现:Transformer的注意力机制和后Transformer的状态更新操作均受限于内存带宽,成为批处理推理的性能瓶颈。基于此,Pimba结合存内处理(PIM)和LLM量化技术,通过以下设计解决内存瓶颈:状态更新处理单元(SPU):每个SPU由两个存储体共享,实现交错访问,在保证吞吐量的同时优化面积效率;基于MX量化的状态更新处理引擎(SPE):采用Microsoft的MX8量化格式,在精度和面积之间达到帕累托最优,支持高效的状态更新和注意力操作;端到端系统设计:将状态更新和注意力操作卸载到PIM,其他任务由GPU处理,兼容现有Transformer服务系统,可作为“即插即用”的替代方案。实验结果显示,Pimba相比LLM优化的GPU和GPU+PIM系统,token生成吞吐量分别提升高达4.1倍和2.1倍,且面积开销较小。创新点统一架构支持:首次提出同时支持Transformer和后Transformer模型的存内加速方案,解决了两类模型共存的服务系统设计挑战;资源共享设计
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑