资讯详情

FLUX.1 结构条件生成实战指南:用 Canny 边缘与 Depth 深度控制实现精准图像重绘

📅 2026/9/11 12:53:48 | 华诺云谱 👁 阅读
FLUX.1 结构条件生成实战指南:用 Canny 边缘与 Depth 深度控制实现精准图像重绘
FLUX.1 结构条件生成实战指南用 Canny 边缘与 Depth 深度控制实现精准图像重绘【免费下载链接】fluxOfficial inference repo for FLUX.1 models项目地址: https://gitcode.com/GitHub_Trending/flux49/flux本文围绕 FLUX.1 官方推理仓库中的结构条件生成Structural Conditioning能力展开系统讲解FLUX.1 Canny [dev]与FLUX.1 Depth [dev]含两个 LoRA 变体的模型体系、权重获取、交互式采样命令、关键采样参数与 TensorRT 加速推理方案。读完本文你将掌握如何在保持原图构图与结构的前提下通过文本引导完成重纹理化retexturing等图像编辑任务并理解控制信号在生成管线中的底层传递机制。什么是结构条件生成结构条件生成Structural Conditioning利用Canny 边缘检测或深度估计Depth Detection来保持在图像变换过程中的精确控制。其核心思路是先提取原图的结构信号——Canny 边缘图刻画轮廓走向深度图刻画空间纵深关系——在后续的文本引导编辑中持续锚定这些结构从而让生成结果在改变纹理、材质、风格等内容属性的同时维持原图的核心构图不变。这一技术路径对重纹理化在保持结构的前提下替换物体表面材质例如把金属机器人换成黄金机器人尤为有效。围绕这一能力官方仓库共发布了四个变体类别控制信号变体全量模型Canny 边缘图FLUX.1 Canny [dev]全量模型深度图FLUX.1 Depth [dev]LoRA 适配器Canny 边缘图基于 FLUX.1 [dev]FLUX.1 Canny [dev] LoRALoRA 适配器深度图基于 FLUX.1 [dev]FLUX.1 Depth [dev] LoRA其中两个 LoRA 变体并不包含独立的主模型权重而是作为 FLUX.1 [dev] 基础模型之上的轻量适配器存在加载时必须同时下载基础模型详见下文LoRA 变体的加载与缩放一节。模型清单、许可与校验值下表汇总了四个变体的模型标识、许可证与sha256sum校验值用于验证下载权重的完整性防止文件损坏或被篡改名称权重来源HuggingFace 模型 ID许可证sha256sumFLUX.1 Canny [dev]black-forest-labs/FLUX.1-Canny-devFLUX.1-dev Non-Commercial License996876670169591cb412b937fbd46ea14cbed6933aef17c48a2dcd9685c98cdbFLUX.1 Depth [dev]black-forest-labs/FLUX.1-Depth-devFLUX.1-dev Non-Commercial License41360d1662f44ca45bc1b665fe6387e91802f53911001630d970a4f8be8dac21FLUX.1 Canny [dev] LoRAblack-forest-labs/FLUX.1-Canny-dev-loraFLUX.1-dev Non-Commercial License8eaa21b9c43d5e7242844deb64b8cf22ae9010f813f955ca8c05f240b8a98f7eFLUX.1 Depth [dev] LoRAblack-forest-labs/FLUX.1-Depth-dev-loraFLUX.1-dev Non-Commercial License1938b38ea0fdd98080fa3e48beb2bedfbc7ad102d8b65e6614de704a46d8b907四个变体均采用FLUX.1 [dev] 非商业许可证完整条款见 model_licenses/LICENSE-FLUX1-dev适用于个人、科研及按许可证约定范围的用途。控制信号如何流入生成管线源码级解读结构条件生成与普通文生图Text-to-Image最本质的区别在于采样时除了文本条件T5-XXL CLIP和噪声潜变量还额外注入了一路图像结构条件img_cond。整条调用链从 src/flux/cli_control.py 的main()入口出发最终汇聚到 src/flux/sampling.py 的prepare_control()与denoise()。控制编码器CannyImageEncoder 与 DepthImageEncoder在 src/flux/modules/image_embedders.py 中定义了两个核心编码器对应两类控制信号CannyImageEncoder调用 OpenCV 的cv2.Canny做边缘检测默认双阈值min_t50、max_t200可在构造时调整。输入图像先被钳制到[-1, 1]并映射回[0, 255]的字节域边缘检测结果再经x / 127.5 - 1.0归一化最终扩展为 3 通道张量送入后续流程。DepthImageEncoder基于深度估计模型LiheYoung/depth-anything-large-hfAutoModelForDepthEstimation输出predicted_depth深度图将其复制到 3 个通道并用bicubic插值抗锯齿开启对齐回输入分辨率同样归一化到[-1, 1]区间。两个编码器都在torch.no_grad()上下文中执行随后经由共享的 VAE 编码器压缩为潜空间表示src/flux/sampling.py#L93-L97。条件图像的预处理与打包prepare_control()src/flux/sampling.py#L70-L104承担了完整的前处理用 PIL 打开条件图像并转为 RGB将图像resize 到与目标生成分辨率一致以噪声潜变量尺寸 × 8 还原的像素尺寸采用LANCZOS重采样保证结构与输出对齐归一化到[-1, 1]并调整维度为(1, C, H, W)依次经控制编码器与 VAE 编码器转bfloat16后按 2×2 patch 打包rearrange作为img_cond存入返回字典。通道级注入为什么 in_channels 是 128普通FLUX.1 [dev]的 transformer 输入通道为 64见 src/flux/util.py 中configs的FluxParams而flux-dev-canny、flux-dev-depth及其 LoRA 变体的in_channels均为128。从源码结构可以推断多出的 64 通道正是打包后的控制条件img_cond在denoise()src/flux/sampling.py#L331-L333中每个采样步都会执行img_input torch.cat((img, img_cond), dim-1)将噪声潜变量与控制条件在通道维拼接后送入 transformer预测出噪声增量后再截取回主序列pred[:, : img.shape[1]]。这种通道级拼接设计正是结构约束能被保持到最后的原因。环境准备与权重获取仓库的安装方式见 README.md推荐在 Python 3.10 环境创建虚拟环境后执行pip install -e .[all]若需使用 TensorRT 后端则需按 README 中 TensorRT 支持一节安装如 NVIDIA PyTorch 容器 pip install -e .[tensorrt]。权重的获取有三种方式启动任意 demo 时系统会自动处理自动下载首次运行 demo 时权重会自动从 HuggingFace 下载到仓库根目录的checkpoints/下按模型 ID 规范化后的子目录存放见 src/flux/util.py 的get_checkpoint_path()。手动放置预先手动下载权重文件放入checkpoints/对应目录可跳过运行时的下载等待。环境变量指定路径手动链接已有权重通过环境变量覆盖默认位置export FLUX_MODELyour model path here export FLUX_AEyour autoencoder path here # optional (see below) export FLUX_LORAyour lora path here其中FLUX_MODEL指向主 transformer 权重safetensorsFLUX_AE指向共享的 autoencoder 权重FLUX_LORA仅在 LoRA 变体下需要。从 get_checkpoint_path() 的实现看若环境变量指向的文件不存在会打印警告并回退到默认位置自动下载若模型仓库属于 gated受限仓库则会提示通过HF_TOKEN环境变量或huggingface-cli login完成认证后重试。需要特别注意的是LoRA 变体flux-dev-canny-lora、flux-dev-depth-lora要求先下载基础 FLUX.1 [dev] 模型。从 configs 可以看到LoRA 变体的repo_id指向基础模型black-forest-labs/FLUX.1-devlora_repo_id才是指向 LoRA 适配器仓库——使用这些变体时系统会自动同时下载基础模型与 LoRA 适配器。交互式采样python -m flux controlCLI 入口由 src/flux/main.py 提供control子命令路由到 src/flux/cli_control.py 的main()。启动交互式采样python -m flux control --name name --loop其中name取值如下对应上文的四个变体flux-dev-cannyflux-dev-depthflux-dev-canny-loraflux-dev-depth-lora--loop开启交互会话每次采样后可以连续更换提示词、条件图像等。交互会话支持以下斜杠指令在提示符输入/h也可随时查看帮助指令作用说明/w width设置输出宽度自动对齐到 16 的倍数/h height设置输出高度自动对齐到 16 的倍数/s seed设置下一次采样的随机种子用于复现结果/g guidance设置引导强度仅 dev 系列模型有效/n steps设置采样步数默认 50/q退出交互会话—对于条件图像与 LoRA 缩放交互会话还提供了独立的输入环节parse_img_cond_path()会询问下一张条件图像路径接受.jpg/.jpeg/.png/.webp输入/q退出LoRA 变体下parse_lora_scale()会进一步询问 LoRA 缩放系数。关键采样参数与默认值cli_control.py 的 main() 签名 定义了完整的命令行参数下表汇总了与结构条件生成最相关的参数及其默认值参数默认值说明--name必填模型名四选一--prompta robot made out of gold文本引导重纹理化场景的核心--img_cond_pathassets/robot.webp条件图像路径jpeg/png/webp即结构来源--width/--height1024/1024输出分辨率应为 16 的倍数--num_steps50采样步数--guidance自动见下引导强度--lora_scale0.85LoRA 缩放系数仅 LoRA 变体--seedNone随机随机种子--devicecuda不可用则cpu推理设备--offloadFalse启用模型/文本编码器/VAE 的顺序换入换出降低显存占用--output_diroutput输出目录文件名为img_{idx}.jpg--track_usageFalse商业许可下的用量上报需设置BFL_API_KEY引导强度guidance的默认值按模型自动设置flux-dev-canny/flux-dev-canny-lora默认30.0flux-dev-depth/flux-dev-depth-lora默认10.0见 cli_control.py#L214-L220。这是因为边缘图与深度图两类控制信号对文本的响应强度不同官方据此给出了不同的校准值。你可以通过--guidance或交互会话中的/g覆盖默认值结合具体任务微调结构保持与文本跟随的平衡。单次生成不进入交互循环的写法例如python -m flux control --name flux-dev-canny --prompt a golden robot --img_cond_path assets/robot.webp --guidance 30.0 --num_steps 50生成结束后图像会写入output/img_{idx}.jpg输出经过 NSFW 分类器Falconsai/nsfw_image_detection阈值 0.85过滤通过后写入 EXIF 元数据软件标记为AI generated;img2img;flux制造商 Black Forest Labs模型名与提示词并叠加不可见水印见 save_image()。LoRA 变体的加载与缩放LoRA 变体在代码层面的实现位于 src/flux/model.py 的FluxLoraWrapper它以 FLUX.1 [dev] 的Flux为基座lora_rank默认 128通过replace_linear_with_lora()将全部nn.Linear层替换为 LinearLora。每个LinearLora的前向计算为output base_out lora_B(lora_A(input)) * scale即基础权重输出叠加低秩分支lora_A、lora_B的增量增量受scale系数控制。在 CLI 中模型加载后会对所有含set_scale方法的模块统一设置lora_scale默认0.85交互会话中也支持随时输入新的 LoRA 缩放值并热更新便于实时对比不同强度下的结构保持效果。需要特别说明的限制TRT 后端目前不支持 LoRA 变体。源码中对此有显式断言assert not trt, TRT does not support LORAcli_control.py#L205-L206因此flux-dev-canny-lora、flux-dev-depth-lora只能走原生 PyTorch 推理路径。TensorRT 加速推理对于 Canny / Depth 两个全量模型变体仓库提供了基于 TensorRT 的加速推理支持导出精度支持BF16、FP8、FP4三档。首先需按 README.md 中 TensorRT 支持一节完成环境安装然后执行python -m flux control --namename --loop --img_cond_pathassets/robot.webp --trt --static_shapeFalse --trt_transformer_precision precision其中precision为bf16、fp8或fp4之一。相关参数说明--trt切换到 TensorRT 后端。此时会通过 src/flux/trt/trt_manager.py 的TRTManager加载 CLIP、Transformer、T5、VAE 与 VAE Encoder 五类引擎引擎目录默认./engines可用TRT_ENGINE_DIR环境变量覆盖--static_shapeFalse关闭静态形状模式允许在会话中动态调整分辨率TRT 引擎构建时使用运行时的宽高--trt_transformer_precision指定 transformer 引擎的精度直接影响显存占用与推理速度的权衡精度越低通常越快、越省显存Transformer 的 ONNX 导出模型会自动从black-forest-labs/FLUX.1-Canny-dev-onnx、black-forest-labs/FLUX.1-Depth-dev-onnx等 ONNX 仓库按精度下载见 download_onnx_models_for_trt()T5 引擎精度可用TRT_T5_PRECISION环境变量覆盖默认bf16。与 diffusers 生态集成除本仓库的参考实现外Flux Control含两个 LoRA 变体同样兼容 Python 的diffusers库。diffusers官方为 FLUX 系列提供了对应的 pipeline 文档你可以直接在该生态中以标准方式加载 Canny / Depth 模型与 LoRA 适配器将其接入既有的 diffusers 工作流如与其他调度器、pipeline 组合。本仓库的 CLI 与diffusers两条路径共用同一套权重与条件编码逻辑可作为实现上的对照参考。参考资源本文主体依据docs/structural-conditioning.md交互式采样入口src/flux/cli_control.py控制编码器实现src/flux/modules/image_embedders.py条件图像前处理与去噪src/flux/sampling.py模型配置与权重下载逻辑src/flux/util.py安装与 TensorRT 支持说明README.md许可证model_licenses/LICENSE-FLUX1-devoutput文章FLUX.1 结构条件生成实战指南用 Canny 边缘与 Depth 深度控制实现精准图像重绘本文围绕 FLUX.1 官方推理仓库中的结构条件生成Structural Conditioning能力展开系统讲解FLUX.1 Canny [dev]与FLUX.1 Depth [dev]含两个 LoRA 变体的模型体系、权重获取、交互式采样命令、关键采样参数与 TensorRT 加速推理方案。读完本文你将掌握如何在保持原图构图与结构的前提下通过文本引导完成重纹理化retexturing等图像编辑任务并理解控制信号在生成管线中的底层传递机制。什么是结构条件生成结构条件生成Structural Conditioning利用Canny 边缘检测或深度估计Depth Detection来保持在图像变换过程中的精确控制。其核心思路是先提取原图的结构信号——Canny 边缘图刻画轮廓走向深度图刻画空间纵深关系——在后续的文本引导编辑中持续锚定这些结构从而让生成结果在改变纹理、材质、风格等内容属性的同时维持原图的核心构图不变。这一技术路径对重纹理化在保持结构的前提下替换物体表面材质例如把金属机器人换成黄金机器人尤为有效。围绕这一能力官方仓库共发布了四个变体类别控制信号变体全量模型Canny 边缘图FLUX.1 Canny [dev]全量模型深度图FLUX.1 Depth [dev]LoRA 适配器Canny 边缘图基于 FLUX.1 [dev]FLUX.1 Canny [dev] LoRALoRA 适配器深度图基于 FLUX.1 [dev]FLUX.1 Depth [dev] LoRA其中两个 LoRA 变体并不包含独立的主模型权重而是作为 FLUX.1 [dev] 基础模型之上的轻量适配器存在加载时必须同时下载基础模型详见下文LoRA 变体的加载与缩放一节。模型清单、许可与校验值下表汇总了四个变体的模型标识、许可证与sha256sum校验值用于验证下载权重的完整性防止文件损坏或被篡改名称权重来源HuggingFace 模型 ID许可证sha256sumFLUX.1 Canny [dev]black-forest-labs/FLUX.1-Canny-devFLUX.1-dev Non-Commercial License996876670169591cb412b937fbd46ea14cbed6933aef17c48a2dcd9685c98cdbFLUX.1 Depth [dev]black-forest-labs/FLUX.1-Depth-devFLUX.1-dev Non-Commercial License41360d1662f44ca45bc1b665fe6387e91802f53911001630d970a4f8be8dac21FLUX.1 Canny [dev] LoRAblack-forest-labs/FLUX.1-Canny-dev-loraFLUX.1-dev Non-Commercial License8eaa21b9c43d5e7242844deb64b8cf22ae9010f813f955ca8c05f240b8a98f7eFLUX.1 Depth [dev] LoRAblack-forest-labs/FLUX.1-Depth-dev-loraFLUX.1-dev Non-Commercial License1938b38ea0fdd98080fa3e48beb2bedfbc7ad102d8b65e6614de704a46d8b907四个变体均采用FLUX.1 [dev] 非商业许可证完整条款见 model_licenses/LICENSE-FLUX1-dev适用于个人、科研及按许可证约定范围的用途。控制信号如何流入生成管线源码级解读结构条件生成与普通文生图Text-to-Image最本质的区别在于采样时除了文本条件T5-XXL CLIP和噪声潜变量还额外注入了一路图像结构条件img_cond。整条调用链从 src/flux/cli_control.py 的main()入口出发最终汇聚到 src/flux/sampling.py 的prepare_control()与denoise()。控制编码器CannyImageEncoder 与 DepthImageEncoder在 src/flux/modules/image_embedders.py 中定义了两个核心编码器对应两类控制信号CannyImageEncoder调用 OpenCV 的cv2.Canny做边缘检测默认双阈值min_t50、max_t200可在构造时调整。输入图像先被钳制到[-1, 1]并映射回[0, 255]的字节域边缘检测结果再经x / 127.5 - 1.0归一化最终扩展为 3 通道张量送入后续流程。DepthImageEncoder基于深度估计模型LiheYoung/depth-anything-large-hfAutoModelForDepthEstimation输出predicted_depth深度图将其复制到 3 个通道并用bicubic插值抗锯齿开启对齐回输入分辨率同样归一化到[-1, 1]区间。两个编码器都在torch.no_grad()上下文中执行随后经由共享的 VAE 编码器压缩为潜空间表示src/flux/sampling.py#L93-L97。条件图像的预处理与打包prepare_control()src/flux/sampling.py#L70-L104承担了完整的前处理用 PIL 打开条件图像并转为 RGB将图像resize 到与目标生成分辨率一致以噪声潜变量尺寸 × 8 还原的像素尺寸采用LANCZOS重采样保证结构与输出对齐归一化到[-1, 1]并调整维度为(1, C, H, W)依次经控制编码器与 VAE 编码器转bfloat16后按 2×2 patch 打包rearrange作为img_cond存入返回字典。通道级注入为什么 in_channels 是 128普通FLUX.1 [dev]的 transformer 输入通道为 64见 src/flux/util.py 中configs的FluxParams而flux-dev-canny、flux-dev-depth及其 LoRA 变体的in_channels均为128。从源码结构可以推断多出的 64 通道正是打包后的控制条件img_cond在denoise()src/flux/sampling.py#L331-L333中每个采样步都会执行img_input torch.cat((img, img_cond), dim-1)将噪声潜变量与控制条件在通道维拼接后送入 transformer预测出噪声增量后再截取回主序列pred[:, : img.shape[1]]。这种通道级拼接设计正是结构约束能被保持到最后的原因。环境准备与权重获取仓库的安装方式见 README.md推荐在 Python 3.10 环境创建虚拟环境后执行pip install -e .[all]若需使用 TensorRT 后端则需按 README 中 TensorRT 支持一节安装如 NVIDIA PyTorch 容器 pip install -e .[tensorrt]。权重的获取有三种方式启动任意 demo 时系统会自动处理自动下载首次运行 demo 时权重会自动从 HuggingFace 下载到仓库根目录的checkpoints/下按模型 ID 规范化后的子目录存放见 src/flux/util.py 的get_checkpoint_path()。手动放置预先手动下载权重文件放入checkpoints/对应目录可跳过运行时的下载等待。环境变量指定路径手动链接已有权重通过环境变量覆盖默认位置export FLUX_MODELyour model path here export FLUX_AEyour autoencoder path here # optional (see below) export FLUX_LORAyour lora path here其中FLUX_MODEL指向主 transformer 权重safetensorsFLUX_AE指向共享的 autoencoder 权重FLUX_LORA仅在 LoRA 变体下需要。从 get_checkpoint_path() 的实现看若环境变量指向的文件不存在会打印警告并回退到默认位置自动下载若模型仓库属于 gated受限仓库则会提示通过HF_TOKEN环境变量或huggingface-cli login完成认证后重试。需要特别注意的是LoRA 变体flux-dev-canny-lora、flux-dev-depth-lora要求先下载基础 FLUX.1 [dev] 模型。从 configs 可以看到LoRA 变体的repo_id指向基础模型black-forest-labs/FLUX.1-devlora_repo_id才是指向 LoRA 适配器仓库——使用这些变体时系统会自动同时下载基础模型与 LoRA 适配器。交互式采样python -m flux controlCLI 入口由 src/flux/main.py 提供control子命令路由到 src/flux/cli_control.py 的main()。启动交互式采样python -m flux control --name name --loop其中name取值如下对应上文的四个变体flux-dev-cannyflux-dev-depthflux-dev-canny-loraflux-dev-depth-lora--loop开启交互会话每次采样后可以连续更换提示词、条件图像等。交互会话支持以下斜杠指令在提示符输入/h也可随时查看帮助指令作用说明/w width设置输出宽度自动对齐到 16 的倍数/h height设置输出高度自动对齐到 16 的倍数/s seed设置下一次采样的随机种子用于复现结果/g guidance设置引导强度仅 dev 系列模型有效/n steps设置采样步数默认 50/q退出交互会话—对于条件图像与 LoRA 缩放交互会话还提供了独立的输入环节parse_img_cond_path()会询问下一张条件图像路径接受.jpg/.jpeg/.png/.webp输入/q退出LoRA 变体下parse_lora_scale()会进一步询问 LoRA 缩放系数。关键采样参数与默认值cli_control.py 的 main() 签名 定义了完整的命令行参数下表汇总了与结构条件生成最相关的参数及其默认值参数默认值说明--name必填模型名四选一--prompta robot made out of gold文本引导重纹理化场景的核心--img_cond_pathassets/robot.webp条件图像路径jpeg/png/webp即结构来源--width/--height1024/1024输出分辨率应为 16 的倍数--num_steps50采样步数--guidance自动见下引导强度--lora_scale0.85LoRA 缩放系数仅 LoRA 变体--seedNone随机随机种子--devicecuda不可用则cpu推理设备--offloadFalse启用模型/文本编码器/VAE 的顺序换入换出降低显存占用--output_diroutput输出目录文件名为img_{idx}.jpg--track_usageFalse商业许可下的用量上报需设置BFL_API_KEY引导强度guidance的默认值按模型自动设置flux-dev-canny/flux-dev-canny-lora默认30.0flux-dev-depth/flux-dev-depth-lora默认10.0见 cli_control.py#L214-L220。这是因为边缘图与深度图两类控制信号对文本的响应强度不同官方据此给出了不同的校准值。你可以通过--guidance或交互会话中的/g覆盖默认值结合具体任务微调结构保持与文本跟随的平衡。单次生成不进入交互循环的写法例如python -m flux control --name flux-dev-canny --prompt a golden robot --img_cond_path assets/robot.webp --guidance 30.0 --num_steps 50生成结束后图像会写入output/img_{idx}.jpg输出经过 NSFW 分类器Falconsai/nsfw_image_detection阈值 0.85过滤通过后写入 EXIF 元数据软件标记为AI generated;img2img;flux制造商 Black Forest Labs模型名与提示词并叠加不可见水印见 save_image()。LoRA 变体的加载与缩放LoRA 变体在代码层面的实现位于 src/flux/model.py 的FluxLoraWrapper它以 FLUX.1 [dev] 的Flux为基座lora_rank默认 128通过replace_linear_with_lora()将全部nn.Linear层替换为 LinearLora。每个LinearLora的前向计算为output base_out lora_B(lora_A(input)) * scale即基础权重输出叠加低秩分支lora_A、lora_B的增量增量受scale系数控制。在 CLI 中模型加载后会对所有含set_scale方法的模块统一设置lora_scale默认0.85交互会话中也支持随时输入新的 LoRA 缩放值并热更新便于实时对比不同强度下的结构保持效果。需要特别说明的限制TRT 后端目前不支持 LoRA 变体。源码中对此有显式断言assert not trt, TRT does not support LORAcli_control.py#L205-L206因此flux-dev-canny-lora、flux-dev-depth-lora只能走原生 PyTorch 推理路径。TensorRT 加速推理对于 Canny / Depth 两个全量模型变体仓库提供了基于 TensorRT 的加速推理支持导出精度支持BF16、FP8、FP4三档。首先需按 README.md 中 TensorRT 支持一节完成环境安装然后执行python -m flux control --namename --loop --img_cond_pathassets/robot.webp --trt --static_shapeFalse --trt_transformer_precision precision其中precision为bf16、fp8或fp4之一。相关参数说明--trt切换到 TensorRT 后端。此时会通过 src/flux/trt/trt_manager.py 的TRTManager加载 CLIP、Transformer、T5、VAE 与 VAE Encoder 五类引擎引擎目录默认./engines可用TRT_ENGINE_DIR环境变量覆盖--static_shapeFalse关闭静态形状模式允许在会话中动态调整分辨率TRT 引擎构建时使用运行时的宽高--trt_transformer_precision指定 transformer 引擎的精度直接影响显存占用与推理速度的权衡精度越低通常越快、越省显存Transformer 的 ONNX 导出模型会自动从black-forest-labs/FLUX.1-Canny-dev-onnx、black-forest-labs/FLUX.1-Depth-dev-onnx等 ONNX 仓库按精度下载见 download_onnx_models_for_trt()T5 引擎精度可用TRT_T5_PRECISION环境变量覆盖默认bf16。与 diffusers 生态集成除本仓库的参考实现外Flux Control含两个 LoRA 变体同样兼容 Python 的diffusers库。diffusers官方为 FLUX 系列提供了对应的 pipeline 文档你可以直接在该生态中以标准方式加载 Canny / Depth 模型与 LoRA 适配器将其接入既有的 diffusers 工作流如与其他调度器、pipeline 组合。本仓库的 CLI 与diffusers两条路径共用同一套权重与条件编码逻辑可作为实现上的对照参考。参考资源本文主体依据docs/structural-conditioning.md交互式采样入口src/flux/cli_control.py控制编码器实现src/flux/modules/image_embedders.py条件图像前处理与去噪src/flux/sampling.py模型配置与权重下载逻辑src/flux/util.py安装与 TensorRT 支持说明README.md许可证model_licenses/LICENSE-FLUX1-dev【免费下载链接】fluxOfficial inference repo for FLUX.1 models项目地址: https://gitcode.com/GitHub_Trending/flux49/flux创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。