🤖 Stable Diffusion本地部署与LoRA微调:从显卡检查到出图验收的深夜实战笔记

首页 › Stable Diffusion本地部署与LoRA微调:从显卡检查到出图验收的深
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

凌晨一点十七分,窗外的雨像细小的电流敲在玻璃上。我把一张旧显卡插回主机,机箱风扇亮起那一刻,像某种沉默机器重新开始呼吸。很多人第一次想做 Stable Diffusion 本地部署,并不是为了炫技,而是想把提示词、草图、人物风格留在自己的电脑里,不必每次都把灵感交给云端。可真正开始时,问题也来了:显存不够怎么办?模型放哪里?LoRA 微调会不会把机器跑崩?这篇笔记,就从我自己反复踩坑的那台 Windows 主机说起。

先判断你的电脑能不能跑:显卡、Python与磁盘空间

📊STEP 1选择模型✅STEP 2准备数据🔧STEP 3调试优化💡STEP 4落地应用

如果你搜索过“Stable Diffusion本地部署教程”,大概率会看到一堆安装方式。先别急着下载,先诊断机器。我的测试机是 RTX 3060 12GB、32GB 内存、1TB SSD;另一台 RTX 2060 6GB 也能跑,但只能更节省地出图和训练。一般来说,生成 512×768 图片,6GB 显存勉强够;如果要训练 LoRA,建议 8GB 起步,12GB 更舒服。磁盘至少预留 40GB,因为一个 SD 1.5 模型约 2GB,一个 SDXL 模型常见 6GB 左右,训练数据和输出很快会膨胀。

先打开命令行检查显卡:

nvidia-smi

如果能看到 CUDA Version、显卡型号和显存占用,说明驱动基本正常。若提示命令不存在,先安装 NVIDIA 官方驱动。Python 建议用 3.10.6,不要盲目装最新版;Git 也要提前安装。很多“Stable Diffusion安装失败”的根因,不是模型问题,而是 Python 版本、路径中文名、驱动太旧。

用 AUTOMATIC1111 WebUI 搭起来:模型放对,比参数更重要

免费和官方路线优先:你可以使用 AUTOMATIC1111 Stable Diffusion WebUI,这是目前资料最多、插件最全的本地方案。新建一个英文路径文件夹,例如 D:\sd-webui,然后在命令行执行:

git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git

cd stable-diffusion-webui

webui-user.bat

第一次启动会下载依赖,我这边 300Mbps 宽带下约 12 分钟完成;如果网络不稳,失败后重复运行即可。模型文件,也就是常见的 .safetensors,放到:

stable-diffusion-webui\models\Stable-diffusion

然后重新启动 WebUI,浏览器通常打开 http://127.0.0.1:7860。如果你在找“Stable Diffusion模型下载”,记住优先选择 safetensors 格式,少碰来源不明的 .ckpt;SD 1.5 模型适合低显存和 LoRA 训练,SDXL 画质更好但吃显存。我实际测试:RTX 3060 12GB,SD 1.5、512×768、20 steps、Euler a,单张约 5.8 秒;SDXL 1024×1024 同步数约 18—28 秒,取决于模型和 VAE。

如果你不知道 Stable Diffusion怎么用,先用一组可复现参数开始:Prompt 写 portrait photo of a young woman, soft light, detailed eyes, 85mm lens,Negative Prompt 写 low quality, blurry, extra fingers, bad hands,采样器选 DPM++ 2M Karras,Steps 20,CFG Scale 7,尺寸 512×768,Seed 固定为 12345。固定 Seed 的意义,是让你能比较模型、插件和提示词变化,而不是被随机性带着走。

LoRA微调:小数据也能做风格,但别让脏数据毁掉结果

2020行业萌芽2021快速增长2022竞争加剧2023洗牌整合2024成熟稳定

真正让我觉得本地部署有温度的,是第一次训练 LoRA。那不是“让 AI 变聪明”,更像把一摞照片、一种笔触、一段审美,悄悄教给机器。推荐使用 kohya_ss 做训练,它对 LoRA、DreamBooth 支持成熟。准备 20—50 张同一风格或同一人物图片,分辨率尽量统一,删掉糊图、遮挡严重、重复角度太多的图。数据质量比数量更重要,我用 32 张干净头像训练出的稳定性,明显好过 120 张杂乱截图。

安装 kohya_ss 的基本流程是:克隆项目,运行 setup,选择 Torch/CUDA 配置。训练参数可以先用保守组合:基础模型选 SD 1.5,resolution 512,network_dim 32,network_alpha 16,learning_rate 1e-4,batch_size 1,epoch 10。图片命名和标签可以用 WD14 Tagger 自动打标,再手动删掉明显错误标签。触发词建议独特,比如 ryportrait_style,不要用太普通的词。

训练时看三件事:显存、loss、样图。RTX 3060 12GB 上,32 张图、10 epoch,我测得约 18 分钟完成,LoRA 文件约 36MB。loss 不需要追求越低越好;如果样图开始变得僵硬、同脸、背景混乱,可能是过拟合,降低 epoch 或减少重复次数。训练完成后,把 LoRA 放到:

stable-diffusion-webui\models\Lora

在提示词里调用:

<lora:your_lora_name:0.7> ryportrait_style, portrait photo, soft light

权重从 0.6 到 0.8 慢慢试。0.3 太弱,1.0 以上容易“糊成训练集”。这也是很多“LoRA训练教程”没有讲透的地方:微调不是复制,而是学会在相似与自由之间保持呼吸。

如何验证它真的可用

验证不要只看一张漂亮图。请固定模型、Seed、采样器和尺寸,分别测试不加 LoRA、LoRA 0.5、LoRA 0.8 三组,每组出 4 张。若主题特征稳定出现,手部和背景没有明显崩坏,显存没有爆掉,WebUI 控制台无红色报错,就算初步成功。再换 3 组不同提示词测试泛化能力:近景头像、半身照、不同光线。如果只有训练角度能看,说明数据太窄;如果完全不像,检查触发词、标签和训练轮数。

如果遇到 CUDA out of memory,先把尺寸降到 512,开启 xformers,batch size 改 1;WebUI 启动参数可加:

set COMMANDLINE_ARGS=--xformers --medvram

技术有时像夜里的电台,你调很久的频,忽然听见清晰的人声。Stable Diffusion 本地部署和模型微调也是这样:不是一键奇迹,而是一次次排查、记录、回看。免费方案已经足够完成大多数学习和创作;如果你还需要整理 AI 生产力工具路径,也可以把睿盈工具作为一个参考入口:https://wizzegroup.com。愿你的机器亮起来时,不只是风扇在转,也有某个画面终于抵达你。

⬅ 上一篇凌晨客服邮件自动归档:用Zapier与Make串起Claude摘要、表格和提醒 下一篇 ➡Gemini API开发入门:从环境配置到3个可落地应用案例

🎯 猜你喜欢

本地部署Stable Diffusion本地部署与模型微调教程:从显存踩坑到L本地部署Stable Diffusion本地部署与LoRA微调实战:从显卡检查本地部署Stable Diffusion本地部署与模型微调实战:从下载安装到出本地部署Stable Diffusion本地部署与模型微调:从下载安装到出图稳本地部署Stable Diffusion本地部署与LoRA微调实战:从能出图到本地部署Stable Diffusion本地部署与模型微调:从零搭建到LoRA本地部署深夜工坊:Stable Diffusion本地部署与模型微调,点亮你的本地部署Windows电脑本地运行7B模型:Ollama与LM Studio安

🏷️ 热门标签

Claude怎么用Claude免费使用Claude注册方法Gemini API怎么用Gemini API教程Gemini API开发入门Google翻译怎么用AI生产力工具DeepL下载Midjourney怎么用GPT-4o怎么用文字转语音工具推荐ChatGPT怎么用Ollama下载Cursor下载LM Studio教程AI论文写作辅助AI语音克隆教程Midjourney教程Runway怎么用
延伸阅读