资讯详情

AngelSlim扩散模型压缩教程:FLUX/Hunyuan-Image FP8量化与TeaCache缓存加速完整指南

📅 2026/10/10 20:22:39 | 华诺云谱 👁 阅读
AngelSlim扩散模型压缩教程:FLUX/Hunyuan-Image FP8量化与TeaCache缓存加速完整指南
人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载AngelSlim 是一个功能全面的模型压缩工具包其扩散模型压缩模块专为 DiTDiffusion Transformer架构打造一条命令即可完成FLUX、Hunyuan-Image等文生图模型的FP8 量化权重体积减半、推理提速并内置TeaCache 缓存加速复用去噪步中间结果显著缩短生图耗时。本文带你从零环境搭建到权重导出部署3 步走完全流程 为什么扩散模型适合 FP8 量化扩散模型如 FLUX.1、Hunyuan-Image的 DiT 主干由大量 Linear 层堆叠而成参数量动辄数十亿BF16 部署时显存开销巨大单张图生成动辄数秒到数十秒。FP8 量化将权重和激活压缩到 8 位浮点显存减半权重存储从 2 字节降到 1 字节推理提速在支持 FP8 的硬件NVIDIA Hopper SM90上可走原生 FP8 GEMM精度可控AngelSlim 提供 5 种量化粒度从 per-tensor 到 per-token 逐层适配。量化原理实现见 angelslim/compressor/diffusion/quant/ptq.pyFP8 矩阵乘法 Triton kernel 见 angelslim/compressor/diffusion/kernels/python/gemm/fp8_gemm.py。3 步快速开始FLUX 一键 FP8 量化第 1 步安装环境git clone https://gitcode.com/gh_mirrors/an/AngelSlim cd AngelSlim pip install -r requirements/requirements.txt第 2 步在线量化 直接推理项目内置命令行工具默认加载 FLUX.1-schnell量化后立刻出图 python scripts/diffusion/run_diffusion.py \ --model-name-or-path black-forest-labs/FLUX.1-schnell \ --quant-type fp8-per-tensor \ --prompt A cat holding a sign that says hello world \ --height 1024 --width 1024 --steps 4 --guidance 0.0 --seed 0运行成功后当前目录会生成black-forest-labs-FLUX.1-schnell_fp8-per-tensor_1024x1024.png。第 3 步导出量化权重供线上复用python scripts/diffusion/run_diffusion.py \ --model-name-or-path black-forest-labs/FLUX.1-schnell \ --fp8-model-save-path ./flux_fp8 \ --quant-type fp8-per-tensor导出的目录包含量化后的transformer权重和fp8_scales.safetensors缩放因子文件推理时加--fp8-model-load-path ./flux_fp8即可跳过在线量化、直接加载。命令行参数详情见 scripts/diffusion/run_diffusion.py。5 种 FP8 量化策略怎么选DynamicDiTQuantizerquant/ptq.py内置 5 种量化类型按需选择即可量化类型特点适用场景fp8-per-tensor⭐推荐权重激活全局缩放速度/精度平衡最佳绝大多数部署场景fp8-per-tensor-weight-only仅权重量化激活仍为 BF16对精度要求更严格fp8-per-block128 元素分块量化 DeepGEMM 加速NVIDIA Hopper (SM90)fp8-per-tokenper-token 细粒度Triton kernel输入分布多样的场景fp8-per-token-sgl基于 SGL kernel 的优化 per-token追求极致矩阵乘效率下面两张图展示了 FP8 量化的实测分析左图为同一层权重在 BF16 与 FP8 下的分布对比量化后分布形态保持一致右图为逐层缩放因子分析可见不同层如mlp.down_proj的 input/weight scale 差异明显这正是需要 per-tensor/per-block 缩放因子的原因。 还可以用include_patterns/exclude_patterns精细控制量化范围支持字符串与正则混合匹配默认量化lin/img/txt等 Linear 层排除embed层from angelslim.compressor.diffusion import DynamicDiTQuantizer quantizer DynamicDiTQuantizer( quant_typefp8-per-tensor, include_patterns[linear, r.*\.attn.*], exclude_patterns[embed, r.*norm.*], )TeaCache 缓存加速复用上一步跳过大半计算FP8 解决的是算得快TeaCache 解决的是少算几步。扩散模型去噪时相邻时间步的中间结果变化很小AngelSlim 的 Cache 模块angelslim/compressor/diffusion/cache/通过包装 DiT block 的forward方法把上一步结果缓存下来在变化小的步骤直接复用 。内置 3 种策略TeaCacheteacache_helper.py基于残差——只存输入输出的差值把它加到缓存输入上即可近似当前步输出精度/加速比表现均衡DeepCachedeepcache_helper.py块级别缓存可指定哪些 block、哪些步骤不参与缓存控制最灵活TaylorCachetaylorcache_helper.py用泰勒展开预测未来步输出张量分解为低频/高频分量提升近似精度。三者共享同一个CacheHelper基类cache_helper.py核心用法from angelslim.compressor.diffusion import TeaCacheHelper # 前 4 步精确计算之后按间隔复用缓存 cache_helper TeaCacheHelper( double_blockstransformer.double_blocks, no_cache_steps{0, 1, 2, 3}, ) cache_helper.enable()只需在 pipeline 的去噪循环里把当前步号同步给cur_timestepcache_helper.cur_timestep i完成后调用cache_helper.disable()即可恢复原始前向逻辑。完整 HunyuanVideo 集成示例见 docs/source/features/diffusion/cache.md。Hunyuan-Image 及其他 DiT 模型同一套接口量化与缓存能力与具体模型解耦——任何能走DiffusionPipeline.from_pretrained加载的 DiT 模型都适用把--model-name-or-path换成目标模型即可python scripts/diffusion/run_diffusion.py \ --model-name-or-path turing-ai-tech/HunyuanImage-2.1 \ --quant-type fp8-per-tensor \ --prompt 一只在雪地里打滚的金毛犬 \ --height 1024 --width 1024 --steps 28 --seed 42Python API 侧同样简洁加载 pipeline →convert_linear(pipe.transformer)一行量化 →export_quantized_weight()导出部署完整示例见 angelslim/compressor/diffusion/README.md。总结一条命令省一半显存TeaCache 再省数倍时间能力入口效果FP8 量化scripts/diffusion/run_diffusion.py权重体积减半SM90 硬件推理提速权重导出/加载export_quantized_weight/load_quantized_model一次量化反复部署TeaCache/DeepCache/TaylorCacheangelslim/compressor/diffusion/cache/跳过去噪步重复计算生成提速 延伸阅读扩散模型量化文档docs/source/features/diffusion/quantization.md扩散模型 Cache 文档docs/source/features/diffusion/cache.md压缩功能总入口docs/source/features/diffusion/index.md掌握这 3 步你就能把 FLUX、Hunyuan-Image 等扩散模型以 FP8 低精度 缓存加速的方式部署到生产环境——更快、更省、更稳。赞分享人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载相关推荐ComfyUI-TeaCache终极指南3步实现扩散模型推理加速TeaCache是一种无需训练的缓存技术专门用于加速扩散模型的推理过程。通过估计并利用模型在不同时间步输出之间的波动差异TeaCache能够显著提升图像扩散人工智能大模型模型优化媒体生成vLLM-Omni 中 TeaCache 加速扩散模型推理从 Hook 机制到新模型接入的完整指南vLLM Omni 中 TeaCache 加速扩散模型推理从 Hook 机制到新模型接入的完整指南 TeaCacheTimestep Embedding A人工智能大模型模型推理服务多模态语音音频媒体生成本地部署ComfyUI-TeaCache实战指南3倍加速扩散模型推理的秘诀ComfyUI TeaCache实战指南3倍加速扩散模型推理的秘诀 你是否曾经为扩散模型漫长的推理时间而烦恼看着进度条缓慢前进等待生成结果的过程令人煎熬。人工智能大模型模型优化媒体生成创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑