ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

8GB 显存跑 Flux 完整指南:Stable Diffusion WebUI Forge 中 NF4 与 GGUF 量化怎么选、怎么部署

8GB 显存跑 Flux 完整指南:Stable Diffusion WebUI Forge 中 NF4 与 GGUF 量化怎么选、怎么部署 8GB 显存跑 Flux 完整指南Stable Diffusion WebUI Forge 中 NF4 与 GGUF 量化怎么选、怎么部署【免费下载链接】stable-diffusion-webui-forge项目地址: https://gitcode.com/GitHub_Trending/st/stable-diffusion-webui-forgeStable Diffusion WebUI Forge 部署 Flux 有两条量化路线已有完整权重、显存 12GB 以上选 NF4 保画质显存 8GB 或只想拿单个量化文件直接跑选 GGUF。下文按“选型 → 环境 → 部署 → 排错”的顺序给出可直接照做的配置与命令。 一分钟选型NF4 与 GGUF 怎么选决策维度NF4BitsAndBytes 4-bitGGUF以 Q5_K_M 为例权重来源需完整 Flux 权重加载时由 Forge 现场量化直接下载社区量化好的单文件压缩倍率4×FP16→4bit3.2×FP16→5bit画质损失小约 5%中等随量化等级变化LoRA 行为完全支持可选 fp16 LoRA 计算部分支持单文件分发不便仍需原始大文件方便一个.gguf走天下适合谁12GB 显存、优先画质8GB 显存、轻量部署一句话结论追求画质且手里有完整权重 → NF4显存吃紧或只想拖一个文件进来就出图 → GGUF。按显存给驻留比例留个参考8GB 卡配 Q5_1 GPU Weight 50%12GB 卡配 NF4 70%16GB 以上直接上 Q8_0 或原始 FP16。环境与素材清单Python 3.10、Git、CUDA 12.1或同档 AMD 显卡显存 ≥8GB12GB 以上更稳克隆仓库后执行pip install -r requirements_versions.txt装齐依赖git clone https://gitcode.com/GitHub_Trending/st/stable-diffusion-webui-forge模型统一放进models/Stable-diffusion/来源三选一FLUX.1-dev 完整 FP16 权重官方仓库 black-forest-labs/FLUX.1-devGGUF 社区量化版TheBloke/FLUX.1-dev-Q5_K_M-GGUFNF4 无独立下载渠道由 Forge 在加载完整模型时生成可选用 download_supported_configs.py 预下载各模型的结构配置省去首次加载时联网抓 config路线 ANF4 4-bit 量化部署 Flux放入完整权重把 FLUX.1-dev 的 safetensors 放进models/Stable-diffusion/。目的NF4 不做离线转换加载器需要读原始权重再压。切换存储精度在模型选择行Checkpoint 所在行找到Diffusion in Low Bits下拉框选bnb-nf4。目的transformer 权重按 4-bit 驻留显存占用降到 FP16 的四分之一。加载模型点 Load Model。权重被调往 CUDA 时backend/operations_bnb.py里的ForgeParams4bit会自动触发 BitsAndBytes 量化无需额外步骤。调 GPU Weight 滑块至 60%–80%驻留越多推理越快但比例过高会把 OOM 风险留给你自己留 20%–40% 给激活值。下拉项的完整定义见 modules_forge/main_entry.py# modules_forge/main_entry.py模型选择行的 Diffusion in Low Bits 下拉项 forge_unet_storage_dtype_options { ... bnb-nf4: (nf4, False), # 4-bit 存储LoRA 同精度计算 bnb-nf4 (fp16 LoRA): (nf4, True) # 仅 LoRA 保持 fp16 }路线 BGGUF 引擎切换与部署下载量化文件取社区量化版flux1-dev-q5_k_m.ggufTheBloke/FLUX.1-dev-Q5_K_M-GGUF。选等级看显存Q4 档最省Q5_K_M 是质量与体积的折中Q8_0 接近无损。放入模型目录同样放models/Stable-diffusion/加载器会把它当作预量化状态字典处理。启动时指定 GGUF 文件这是本路线的关键命令行动作python launch.py --gguf-model models/Stable-diffusion/flux1-dev-q5_k_m.gguf切换推理引擎在生成设置中选择 GGUF Engine 作为推理后端。文件内标明的量化类型Q2_KQ8_0、BF16会由backend/operations_gguf.py中的quants_mapping自动分发到对应解码类不需要手工指定等级分发与识别逻辑见 backend/loader.py。 常见问题OOM 快速修复与量化排错症状CUDA out of memory处理GPU Weight 降到 50%仍溢出则启用 modules_forge/cuda_malloc.py 做显存碎片整理。8GB 卡建议 Q5_1 50% 驻留的组合起步确认出图后再往上加。症状GGUF 文件放好了但加载失败处理先核对文件完整性断点续传下载最容易坏再确认量化类型在packages_3rdparty/gguf支持列表内。正常加载时日志应出现预量化状态字典的识别信息没有则说明文件没被认出来。症状NF4 量化后画面发糊、细节丢失处理把distilled_cfg_scale调到 3.5–4.0 区间该项默认 3.5定义在 backend/diffusion_engine/flux.py。症状挂了 LoRA 后图像畸变、闪烁处理下拉框从bnb-nf4切到bnb-nf4 (fp16 LoRA)让 LoRA 矩阵在 fp16 下计算权重本体仍保持 4-bit。⚙️ 进阶调优混合精度与显存驻留Forge 的存储精度是按组件独立决定的T5 文本编码器跟随text_encoder_dtype()transformer 则允许被forge_unet_storage_dtype强制覆盖因此“T5 用 fp16 transformer 用 nf4”这类混合精度组合天然可行不必改代码# backend/loader.pytransformer 的存储精度可被启动参数强制覆盖 unet_storage_dtype_overwrite backend.args.dynamic_args.get(forge_unet_storage_dtype) if unet_storage_dtype_overwrite is not None: storage_dtype unet_storage_dtype_overwrite # 例如 nf4配合load_model_gpubackend/memory_management.py按剩余显存在 fp16/bf16 间自动切换计算精度低显存下无需手动干预。选型判断标准与资源判断标准只有一条有完整权重且显存 ≥12GB 就选 NF4 保画质8GB 级显存或只想要单个小文件就选 GGUF。项目说明README.md版本动态NEWS.md配置预下载脚本download_supported_configs.pyGGUF 量化映射backend/operations_gguf.py【免费下载链接】stable-diffusion-webui-forge项目地址: https://gitcode.com/GitHub_Trending/st/stable-diffusion-webui-forge创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表