Nunchaku FLUX.1-dev图文教程:Blackwell显卡FP4模型安装与验证
Nunchaku FLUX.1-dev图文教程Blackwell显卡FP4模型安装与验证1. 前言为什么选择Nunchaku FLUX.1-dev如果你最近入手了最新的Blackwell架构显卡比如RTX 50系列肯定想找点能发挥它性能的AI应用试试手。今天要聊的Nunchaku FLUX.1-dev就是个特别适合用来“压榨”新显卡性能的文生图模型。简单来说FLUX.1-dev是Black Forest Labs推出的一个开源图像生成模型而Nunchaku团队为它做了专门的优化和量化让它能在消费级显卡上跑起来。最吸引人的是他们专门为Blackwell显卡推出了FP4量化版本——这意味着你手里的新显卡能跑得更快、更省显存。我花了一下午时间在ComfyUI里把整个流程跑通了。从环境准备到最终出图中间踩了几个小坑但整体还算顺利。这篇文章就是我的完整记录我会用最直白的方式带你一步步搞定所有安装和配置最后生成你的第一张FLUX.1-dev图片。2. 准备工作检查你的装备在开始折腾之前先看看你的电脑能不能跑起来。别急着下载检查这几样东西能省下不少时间。2.1 硬件要求首先看显卡。Nunchaku FLUX.1-dev有几个不同的版本对应不同的显卡Blackwell显卡如RTX 50系列必须用FP4量化版。这是专门为新架构优化的用其他版本可能跑不起来或者效果不对。其他NVIDIA显卡20/30/40系列优先用INT4量化版。如果你的显存够大比如24GB以上也可以试试FP8版。显存大小FP4/INT4版大概需要8-12GB显存FP8版需要17GB左右原版FP16则需要恐怖的33GB。所以大部分朋友应该都是从量化版开始。除了显卡内存建议16GB以上硬盘空间至少留出20GB给模型文件。2.2 软件环境软件方面倒是不复杂主要是Python和几个必要的库Python 3.10建议用3.10或3.11太新或太旧的版本可能会有兼容性问题。Git用来下载代码如果你还没装去官网下一个就行。PyTorch这个要注意版本匹配。去PyTorch官网根据你的系统和CUDA版本选择对应的安装命令。不确定的话可以用nvcc --version查一下CUDA版本。huggingface_hub下载模型必备的工具。安装命令很简单pip install --upgrade huggingface_hub环境检查完了如果都没问题我们就可以进入正题了。3. 安装部署两步搞定Nunchaku插件Nunchaku FLUX.1-dev需要配合ComfyUI使用所以我们要先装ComfyUI再装Nunchaku插件。别担心过程比想象中简单。3.1 安装ComfyUI-nunchaku插件有两种安装方法选你觉得顺手的就行。方法A用Comfy-CLI最省事如果你喜欢命令行这个方法最直接。打开终端依次输入# 安装ComfyUI命令行工具 pip install comfy-cli # 安装ComfyUI本体如果已经装过可以跳过 comfy install # 安装Nunchaku插件 comfy noderegistry-install ComfyUI-nunchaku # 移动插件到正确目录 mv ComfyUI-nunchaku ComfyUI/custom_nodes/nunchaku_nodes这几行命令执行完插件就装好了。Comfy-CLI会自动处理依赖比较适合新手。方法B手动安装更灵活如果你想自己控制安装位置或者已经有一个ComfyUI环境了用手动安装# 1. 下载ComfyUI如果已经下载过直接进目录就行 git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI # 安装依赖 pip install -r requirements.txt # 2. 下载Nunchaku插件 cd custom_nodes git clone https://github.com/mit-han-lab/ComfyUI-nunchaku nunchaku_nodes手动安装的好处是你能清楚看到文件放在哪以后维护起来方便。3.2 安装Nunchaku后端插件装好后还需要安装后端支持。从v0.3.2版本开始这个过程变得特别简单启动ComfyUI后面会讲怎么启动在网页界面里你应该能看到一个install_wheel.json的工作流加载这个工作流然后点击运行系统就会自动下载并安装所需的后端wheel包。如果没看到这个工作流可以去插件的example_workflows文件夹里找找。4. 模型准备下载正确的文件插件装好了接下来要下载模型文件。这是最关键的一步文件放错地方或者下错版本后面就全白费了。4.1 配置工作流文件为了让ComfyUI能识别Nunchaku的工作流我们需要把示例文件复制到指定位置# 进入ComfyUI根目录 cd ComfyUI # 创建工作流目录如果不存在的话 mkdir -p user/default/example_workflows # 复制Nunchaku的工作流示例 cp custom_nodes/nunchaku_nodes/example_workflows/* user/default/example_workflows/复制完成后重启ComfyUI你应该就能在网页界面里加载这些工作流了。4.2 下载基础FLUX模型FLUX.1-dev需要一些基础模型支持主要是文本编码器和VAE。这些是必装的不然模型跑不起来。文本编码器模型放在models/text_encoders/目录下# 下载CLIP文本编码器 hf download comfyanonymous/flux_text_encoders clip_l.safetensors --local-dir models/text_encoders # 下载T5文本编码器 hf download comfyanonymous/flux_text_encoders t5xxl_fp16.safetensors --local-dir models/text_encodersVAE模型放在models/vae/目录下# 下载VAE模型 hf download black-forest-labs/FLUX.1-schnell ae.safetensors --local-dir models/vae如果你之前已经下载过这些模型也可以创建软链接。比如我的环境里文件结构是这样的~/ComfyUI/models/text_encoders/ ├── clip_l.safetensors - /root/.cache/huggingface/FLUX.1-dev/text_encoders/clip_l.safetensors └── t5xxl_fp16.safetensors - /root/.cache/huggingface/FLUX.1-dev/text_encoders/t5xxl_fp16.safetensors ~/ComfyUI/models/vae/ └── ae.safetensors - /root/.cache/huggingface/FLUX.1-dev/vae/ae.safetensors软链接的好处是节省硬盘空间一个模型文件可以给多个项目用。4.3 下载Nunchaku FLUX.1-dev主模型终于到主角了根据你的显卡类型选择对应的版本Blackwell显卡用户下载FP4版本其他NVIDIA显卡用户下载INT4版本显存充足想试效果可以下FP8版本以INT4版本为例下载命令如下# 下载INT4量化版主模型 hf download nunchaku-tech/nunchaku-flux.1-dev svdq-int4_r32-flux.1-dev.safetensors --local-dir models/unet/这个文件比较大大概4-8GB取决于你选的版本。下载时需要保持网络通畅如果中断了可以用--resume参数继续。下载完成后检查一下models/unet/目录应该能看到类似这样的文件svdq-int4_r32-flux.1-dev.safetensors # INT4版本 # 或者 svdq-fp4_r32-flux.1-dev.safetensors # FP4版本Blackwell专用4.4 可选下载LoRA模型LoRA可以理解为“风格插件”能让生成的图片有特定的风格效果。Nunchaku推荐了几个不错的LoRAFLUX.1-Turbo-Alpha加速生成减少推理步数Ghibsky Illustration吉卜力动画风格其他风格LoRA根据你的喜好选择下载LoRA到models/loras/目录# 示例下载某个LoRA具体链接看官方文档 # hf download [作者]/[模型名] [文件名].safetensors --local-dir models/loras我的loras目录里是这样models/loras/ ├── diffusion_pytorch_model.safetensors └── lora_v2.safetensorsLoRA不是必须的但用了之后效果会更有趣。特别是FLUX.1-Turbo-Alpha能显著提升生成速度。5. 运行体验生成你的第一张图片所有文件都准备好了现在可以启动ComfyUI开始创作了。5.1 启动ComfyUI在ComfyUI根目录下运行python main.py如果一切正常你会看到类似这样的输出Starting server To see the GUI go to: http://127.0.0.1:8188在浏览器里打开这个地址通常是http://127.0.0.1:8188就能看到ComfyUI的界面了。5.2 加载Nunchaku工作流ComfyUI启动后我们需要加载专门为Nunchaku FLUX.1-dev准备的工作流。推荐用nunchaku-flux.1-dev.json这个工作流功能最全支持多LoRA加载。加载方法点击网页右上角的Load按钮找到user/default/example_workflows/目录选择nunchaku-flux.1-dev.json加载成功后界面应该类似这样这个工作流已经预配置好了所有节点包括文本编码器、模型加载、VAE解码等。你只需要关注几个关键参数就行。5.3 设置参数并生成图片现在到了最有意思的部分——输入提示词让AI帮你画图。第一步写提示词找到工作流中的Positive Prompt节点输入你的描述。FLUX模型对英文提示词支持更好所以尽量用英文写。比如A beautiful landscape with mountains and lakes, ultra HD, realistic, 8K或者更有创意的A cyberpunk city at night, neon lights, raining, reflective wet streets, cinematic lighting第二步调整参数可选有几个参数你可以按需调整推理步数Steps默认20-30步。如果用了FLUX.1-Turbo-Alpha LoRA可以降到10-15步。分辨率Resolution默认1024x1024。显存不够的话可以降到768x768或512x512。LoRA权重如果加载了LoRA可以调整权重控制风格强度一般0.5-1.0之间。采样器Sampler默认的DPM 2M Karras就不错。第三步点击运行一切就绪后点击右边的Queue Prompt按钮。第一次运行会稍微慢一点因为要加载模型。后续生成就会快很多。等待片刻你就能在预览窗口看到生成的图片了如果对效果不满意可以调整提示词再试。FLUX.1-dev对提示词比较敏感多试几次就能找到感觉。6. 常见问题与注意事项在安装和使用过程中我遇到了几个小问题这里总结一下帮你避坑。6.1 文件放错位置这是最容易出错的地方。记住这个目录结构ComfyUI/models/ ├── unet/ # FLUX.1-dev主模型放这里 │ └── svdq-xxx-flux.1-dev.safetensors ├── loras/ # LoRA模型放这里 │ └── xxx.safetensors ├── text_encoders/ # 文本编码器放这里 │ ├── clip_l.safetensors │ └── t5xxl_fp16.safetensors └── vae/ # VAE模型放这里 └── ae.safetensors如果启动时报错说找不到模型第一件事就是检查文件路径对不对。6.2 显存不足问题不同版本的显存占用差异很大FP16原版约33GB一般显卡跑不动FP8量化版约17GB24GB显存显卡可以试试INT4/FP4量化版8-12GB大部分显卡都能跑如果你在生成图片时遇到显存不足的报错可以尝试降低输出分辨率比如从1024x1024降到768x768使用量化版本如果你现在用的是FP8换成INT4/FP4关闭其他占用显存的程序6.3 Blackwell显卡专用提示如果你用的是RTX 50系列等Blackwell架构显卡特别注意必须使用FP4版本INT4版本在Blackwell上可能无法运行或性能不佳驱动更新确保显卡驱动是最新的最好用NVIDIA官方最新版CUDA版本Blackwell需要CUDA 12.4或更高版本6.4 工作流节点缺失有时候加载工作流会提示缺少某些节点。这是因为ComfyUI的插件生态比较分散不同工作流可能依赖不同的自定义节点。解决方法通过ComfyUI-Manager安装缺失的节点或者手动安装提示中提到的节点如果只是少数节点缺失可以尝试在工作流中删除或替换它们6.5 推理步数设置这里有个重要细节如果关闭了FLUX.1-Turbo-Alpha LoRA推理步数不能低于20步。因为Turbo LoRA的作用就是加速生成少了它模型需要更多步数来达到好的效果。如果步数太少生成的图片质量会明显下降可能出现模糊、细节缺失等问题。我的建议是用Turbo LoRA步数设10-15不用Turbo LoRA步数设20-30追求最高质量步数可以设到50但时间会很长7. 总结与建议走完整个流程我觉得Nunchaku FLUX.1-dev在ComfyUI上的体验还是挺不错的。特别是为Blackwell显卡优化的FP4版本确实能感受到性能提升。给新手的几个建议从量化版开始除非你的显存特别大否则INT4/FP4版本是首选。速度够快质量损失也不明显。善用LoRAFLUX.1-Turbo-Alpha LoRA能大幅提升生成速度建议都装上。其他风格LoRA可以根据喜好选择。提示词要具体FLUX模型对提示词响应很好但需要比较具体的描述。与其写“一只猫”不如写“一只橘色条纹猫在窗台上晒太阳阳光明媚细节丰富”。多试几次AI生成有一定随机性同样的提示词跑3-5次选效果最好的那张。注意显存生成过程中可以打开任务管理器看看显存占用如果接近满了下次就降低分辨率或换量化版本。最后如果你在过程中遇到其他问题可以到Nunchaku的GitHub页面看看Issues很可能已经有人遇到并解决了。或者加入相关的社区、Discord群组那里有很多热心的大佬可以帮忙。获取更多AI镜像想探索更多AI镜像和应用场景访问 CSDN星图镜像广场提供丰富的预置镜像覆盖大模型推理、图像生成、视频生成、模型微调等多个领域支持一键部署。