AI教程

Stable Diffusion 教程:模型选择、ComfyUI 首图、参数实验与商用验收

StableDiffusion不是单一软件。本文帮新手区分模型、checkpoint、ComfyUI与云平台,选择SD3.5/SDXL和部署路线,生成第一张可复现图片,并完成参数实验、故障排查、许可证、素材权利与发布标识验收。

Stable Diffusion 入门先从任务和硬件约束选择云端、ComfyUI Desktop、Portable、手动安装或 Diffusers,再固定模型版本与生成记录
本页目录
  1. Stable Diffusion、模型文件、ComfyUI 和在线平台有什么区别?
  2. 2026 年先选哪个模型?不要把“最新”当成唯一答案
  3. 云端、ComfyUI Desktop、Portable、手动安装还是 Diffusers?
  4. 安装前检查:显存不是唯一门槛
  5. 用 ComfyUI 生成第一张可复现图片
  6. Prompt、seed、steps、guidance 和 sampler 应该怎么调?
  7. 什么时候用文生图、图生图、局部重绘、ControlNet 或 LoRA?
  8. 常见报错如何定位?
  9. “模型允许商用”不等于图片可以放心商用
  10. 从第一次出图到稳定交付的十道门
  11. Stable Diffusion 常见问题
  12. 零基础应该先学 ComfyUI 还是 AUTOMATIC1111?
  13. 没有 NVIDIA 显卡还能使用吗?
  14. 多少显存才能运行 SD3.5?
  15. 复制别人的 workflow JSON 就能复现吗?
  16. 模型生成的图片自动属于我吗?
  17. 怎样判断参数调整真的有效?

一句话答案:Stable Diffusion 不是一个固定网站或单一“最新版软件”,而是一组可本地或云端运行的图像生成模型。零基础用户应先选定模型身份 + 运行界面 + 部署方式,再用同一 prompt、seed、尺寸和参数生成基线图;确认模型文件来源、许可证、输入素材权利与发布标识后,才适合把结果用于正式内容或商业项目。

旧稿更正:本站旧版把 Stable Diffusion 写成“目前最强大的开源 AI 绘画模型”,承诺“瞬间高清”“不再依赖付费平台”和从提示词直接成为“AI 艺术家”,还混用了 SD 1.x、SDXL、SD3/3.5 的参数习惯。这些说法忽略了模型版本、许可证、硬件、界面、工作流和输入素材权利。本文按 2026 年 7 月 16 日可核验资料重建;模型清单、权重访问条件、许可证、ComfyUI/PyTorch 兼容性和平台价格使用前仍须复查。
Stable Diffusion 入门先从任务和硬件约束选择云端、ComfyUI Desktop、Portable、手动安装或 Diffusers,再固定模型版本与生成记录
正确顺序是先确定交付任务,再选模型和运行路线;“Stable Diffusion、ComfyUI、checkpoint、工作流”不是同一个东西。本站依据 Stability AI、ComfyUI 与 Diffusers 官方资料原创绘制。

Stable Diffusion、模型文件、ComfyUI 和在线平台有什么区别?

Stable Diffusion 通常指 Stability AI 发布或许可的一组图像生成基础模型及其生态。模型负责把文本、潜变量和可选图像条件变成结果;ComfyUI、AUTOMATIC1111 或代码库只是加载模型和组织推理的工具;在线平台则可能托管 Stable Diffusion,也可能使用完全不同的模型。看见相似界面或“SD”字样,不能推断底层版本、许可证或输出权利相同。

早期 Stable Diffusion 建立在潜空间扩散上:图像经 VAE 压缩到潜变量,去噪网络在文本条件下逐步生成,再由 VAE 解码。可核对原始的 Latent Diffusion 论文。SD3/3.5 仍在潜空间生成,但使用 Rectified Flow 与 MMDiT 路线;架构和采样假设不能直接照搬 SD 1.5/SDXL 教程,见 Stable Diffusion 3 论文

名词 它是什么 实施时必须记录 常见误区
模型系列 SD 1.x、SDXL、SD3/3.5 等架构与权重家族 仓库、模型卡、revision、许可证 把“SD”当成永远相同的模型
Checkpoint 基础模型、微调或合并后的权重文件 文件名、来源页、SHA-256、基础架构 只看封面图,不查来源和适配架构
VAE/文本编码器 图像潜变量和文本条件相关组件 是否内置、独立版本、精度 随意混配导致偏色、噪点或加载失败
LoRA/ControlNet 风格/主体适配或结构条件组件 基础模型、权重、触发词、来源和许可 认为所有 LoRA 可跨 SDXL/SD3.5 通用
界面/工作流 ComfyUI 等推理编排工具及节点图 程序版本、节点版本、workflow JSON 把界面版本当成模型版本
托管平台 供应商代为运行模型的服务 实际模型、条款、区域、保留与费用 把平台“可下载”当成模型可商用

2026 年先选哪个模型?不要把“最新”当成唯一答案

Stability AI 的当前 Core Models 清单列出 Stable Diffusion 3.5 Medium、Large、Large Turbo、SD3 Medium 和部分 Turbo/视频模型。清单会变化,因此正文不把任何一个型号写成永久“最强”。选择取决于工作流生态、文字遵循、速度、显存/内存、许可证和已有资产,而不是年份。

候选 适合先验证什么 官方证据入口 不要直接推断
SD3.5 Large 复杂提示、排版文字与较新 MMDiT 工作流 官方模型卡 模型卡示例图等于你的业务效果;权重大小等于显存需求
SD3.5 Large Turbo 少步数生成与交互速度 官方模型卡 少步数在所有风格、尺寸和量化方案下都更优
SD3.5 Medium 较小模型与本地资源折中 官方模型卡 “Medium”必然能在任意消费显卡顺畅运行
SDXL 1.0 成熟的社区 checkpoint、LoRA 与控制生态 SDXL 模型卡 生态成熟等于许可清晰或适合所有中文文字任务
SD 1.5 生态 必须兼容旧插件、旧 LoRA 或低分辨率资产的遗留项目 具体 checkpoint 的模型卡与许可证 名称含 SD 1.5 就由 Stability AI 官方维护

每个第三方 checkpoint 都是独立供应链对象。即使它基于一个可商用基础模型,也仍要检查作者、训练数据声明、许可证、使用限制和文件哈希。可用站内的信息源与引用核验方法建立模型来源卡;不要从网盘合集、搜索广告或不明启动器下载可执行文件。

云端、ComfyUI Desktop、Portable、手动安装还是 Diffusers?

路线 适合谁 主要优点 主要代价/停止线
可信云端服务 先验证需求、没有合适 GPU、偶尔使用 无需维护驱动,按量试错 先核对模型身份、数据保留、地区、费用与内容条款;敏感素材不能默认上传
ComfyUI Desktop Windows + NVIDIA 且希望安装器管理环境的新手 环境隔离、图形化节点、迁移入口 官方页面仍标注 Beta;实际界面可能变化
ComfyUI Portable Windows、本地解压运行、需要独立 Python 目录可搬迁、便于冻结与回滚 仅从官方入口下载;更新前备份 workflow 和节点清单
ComfyUI 手动安装 Linux/AMD/Intel/Apple/特殊加速器或需精确依赖控制 硬件路线更灵活 需要理解 Python、PyTorch 与驱动;按当前系统要求选择,不复制旧命令
Diffusers/Python 开发、批处理、API、自动测试和可观测性 代码可审计、易集成 必须锁定依赖、revision 与生成记录;先看Diffusers Quicktour

如果目标只是“判断 Stable Diffusion 是否适合我的任务”,先用云端或官方示例跑 12—20 个真实任务,比先买显卡更稳妥。如果需要数据不出本地、反复批量生成、节点级复用或自定义模型,再比较本地方案。可结合本地、云端与混合部署决策硬件采购证据与验收方法,不要按一张“显存推荐表”直接下单。

安装前检查:显存不是唯一门槛

显存需求随模型、精度、文本编码器、VAE、分辨率、批量、ControlNet/LoRA、注意力实现、offload 和并发变化。模型仓库中 16 GB 的权重文件不表示运行时只需 16 GB 显存,反过来也不能用文件大小断言必须购买某档显卡。Diffusers 内存优化文档也强调,不同 UNet/Transformer 架构对 offload、分片或量化的收益不同。

检查项 发布前记录 最低验收
硬件/驱动 GPU、显存、RAM、磁盘、OS、驱动与加速后端 官方当前支持;不拿“能启动”代替持续稳定
模型身份 仓库、revision、文件 SHA-256、基础架构、许可证 来源可追溯;不加载不明 pickle/可执行文件
运行环境 ComfyUI commit/release 或 Python、PyTorch、Diffusers 版本 与系统 Python 隔离;可导出依赖
基线任务 真实 prompt、尺寸、seed、步数、批量、成功标准 连续运行并保存日志、峰值资源、耗时和失败
回滚 旧版本、workflow JSON、节点清单、模型哈希 更新失败能恢复,不覆盖唯一工作环境

资源不足时,按“减小批量/尺寸 → 关闭附加组件 → 使用模型适配的 offload/分片 → 验证量化质量 → 更换模型或云端”逐级处理。量化并非免费压缩,需参照量化精度、显存与质量验收对业务图像复测。

用 ComfyUI 生成第一张可复现图片

  1. 只从官方入口安装。按系统要求选择 Desktop、Portable 或手动安装;把下载页面、安装包版本和哈希记入项目记录。
  2. 选择与模板匹配的模型。先打开模型卡,接受必要的 gated 条款,确认架构、组件、许可证和官方示例工作流;不要把 SDXL workflow 直接换成 SD3.5 checkpoint。
  3. 加载官方/内置基础模板。ComfyUI 首图指南覆盖模板加载、模型安装和第一次文生图;界面变化时以该页为准。
  4. 确认六段数据流。Checkpoint/组件加载 → 正向/负向文本条件 → 初始 latent → sampler/scheduler 去噪 → VAE 解码 → 保存图片。
  5. 固定生成卡。保存模型 revision/哈希、workflow JSON、prompt、negative prompt、seed、尺寸、步数、CFG/guidance、sampler/scheduler、精度、节点版本和时间。
  6. 生成基线而非“神图”。先用简单、有可判定对象/数量/位置/文字的任务确认链路,再换成业务任务;失败也保存。
  7. 更新前做回归。官方更新文档区分开发版与 stable 路线;生产环境先复制环境或 canary,不在唯一实例上直接升级。

自定义节点会执行代码,不是“拖进工作流就安全”。安装前检查仓库所有者、提交记录、依赖和权限;能用核心节点完成时先不用自定义节点。ComfyUI 当前的 Manager 安装说明应作为入口,但“能被 Manager 找到”也不等于经过本站安全审计。

建议每次生成至少保存一条文本化记录:项目/任务 ID、模型仓库与 revision、每个权重 SHA-256、ComfyUI/节点版本、workflow JSON 哈希、输入图片哈希、完整 prompt、seed、尺寸、采样设置、输出文件哈希、开始/结束时间、峰值显存/RAM、错误和人工处理。图片元数据可能在压缩或平台上传时丢失,不能作为唯一记录;生成卡应单独存入版本库或受控资产系统,并与最终交付文件一一对应。

Stable Diffusion 可复现生成卡记录模型哈希、工作流、输入素材、提示词、seed、尺寸、采样参数、环境、输出与权利审核
可复现不是只记 seed:模型、环境、工作流、输入和后处理都可能改变结果;生成卡还要连接来源与发布权利。

Prompt、seed、steps、guidance 和 sampler 应该怎么调?

不要背“万能参数”。不同模型家族和蒸馏版本对 guidance、负向提示词和步数的建议不同。例如Diffusers 的 SD3 pipeline 文档给出当前参数接口,但示例值只是起点,不是适用于所有 checkpoint 的最佳值。

变量 它控制什么 正确实验 错误做法
Prompt 主体、动作、环境、构图、媒介、光线和约束 先写可验证内容,再加风格;记录准确文本 堆几十个互相冲突的“高质量词”
Negative prompt 部分模型/工作流的排除条件 先看模型卡;逐项验证是否有用 把旧版负面词整段复制到所有模型
Seed 随机初始状态的重要输入 同环境固定 seed 做单变量对照 认为 seed 可跨 GPU/PyTorch/节点保证逐像素一致
Steps 去噪/流匹配迭代次数 按模型建议设低、中、高三档,看收益是否饱和 步数越多必然越清晰
Guidance/CFG 文本条件影响强度 围绕模型卡建议做小范围扫描 越高越听话且没有画质代价
Sampler/scheduler 迭代轨迹和噪声/时间步调度 其余变量固定,比较失败类型和耗时 用名字判断谁“绝对最好”
尺寸/批量 构图空间、资源和吞吐 从模型建议分辨率起步,分别测单图与并发 直接要求原生 4K 或用放大后尺寸冒充原生

更可靠的首轮实验是 12 个真实任务 × 每项 3 个 seed。先冻结模型与 workflow,只改变一个变量;同时记录任务成功、主体/数量/文字错误、人工选择时间、峰值显存、端到端耗时和失败。选出候选后再扩大样本。Diffusers 可复现性说明提醒,跨平台和不同 PyTorch 版本不能保证完全复现,因此目标应是可解释回归,而不是承诺任何机器像素一致。

什么时候用文生图、图生图、局部重绘、ControlNet 或 LoRA?

任务 优先路线 必须保留的证据 独立风险
从概念探索画面 文生图 + 多 seed 候选 prompt、模型、参数、筛选标准 把偶然好图包装成稳定能力
保留参考图构图/色调 图生图,逐级测试 denoise/strength 参考图来源、授权、强度和输出差异 无权上传客户、人物或受保护作品
修正局部对象 局部重绘 + mask + 上下文 原图、mask、修改 prompt 和版本 边缘/身份漂移及未披露实质修改
控制姿态、深度、边缘 适配当前架构的 ControlNet/adapter 预处理器、控制权重、强度、来源 控制模型和基础模型不兼容
稳定主体/产品/风格 有权数据训练或使用 LoRA 训练集权利、caption、基础模型、训练配置和许可 肖像、商标、角色、艺术家风格与数据泄漏
批量生产 版本化 workflow/API + 人工质量门 输入清单、失败、成本、审批和回滚 只统计出图数,不统计返工与权利失败

通用指南只负责路由,不把这些专项任务压缩成几段“高级技巧”。LoRA、ControlNet、局部重绘和放大应各自有可复现、经过复核的独立教程;在对应旧页面完成 A/B 级整改前,本页不把它们作为可靠下一步推荐。

常见报错如何定位?

症状 先查 处理顺序 停止线
模型不显示 文件路径、扩展名、模型扫描日志 按官方目录放置、刷新/重启、检查额外模型路径 来源不明或需要运行未知安装器
加载 shape/key 错误 基础架构、workflow 节点、VAE/文本编码器 回到模型卡官方示例,撤掉附加组件 靠忽略大量 missing/unexpected keys 继续生产
CUDA/显存不足 峰值显存、分辨率、批量、附加模型和精度 减批量/尺寸,关闭控制组件,再做适配的 offload/量化 系统频繁崩溃或输出质量未经复测
黑图/纯噪声/偏色 VAE、精度、模型组件、数值溢出和输出范围 跑官方最小 workflow,逐项恢复自定义节点 无法在干净环境复现基线
文字/手部/数量失败 任务是否超出模型稳定边界 拆任务、提供结构条件、局部修复或人工编辑 对外承诺“精准文字/绝不畸形”
更新后 workflow 失效 ComfyUI、节点、Python/PyTorch 和模型 diff 回滚 canary,固定版本逐项升级 唯一环境、无 JSON/依赖备份
同 seed 结果变化 硬件、PyTorch、精度、节点、sampler 和输入元数据 比较生成卡,定义感知/任务容差 把跨环境逐像素一致写进交付承诺

“模型允许商用”不等于图片可以放心商用

Stability AI 当前许可证页面按 Core Models、用途和组织年收入区分 Community 与 Enterprise 条件;基础模型、第三方 checkpoint、LoRA、界面、云平台和输入素材可能分别适用不同条款。Stability AI 的可接受使用政策还适用于自托管权重。实施前应保存当日条款,不把本文当法律意见。

权利层 要问什么 最低留档
基础模型 该具体版本是否在当前许可范围,商业门槛和分发义务是什么? 模型卡、许可证正文、访问日期、组织适用结论
微调/LoRA/节点 作者是否有权授权,是否另有限制或代码许可证? 来源页、作者、license、哈希、依赖清单
输入素材 照片、肖像、商标、角色、字体和客户数据是否允许上传、改编和发布? 权属、同意、用途、期限、地域和删除要求
输出 是否近似第三方作品/人物/品牌,是否需要人工创作贡献和声明? 相似性复核、人工编辑记录、审批人和渠道规则
发布标识 发布地、平台和业务角色要求哪些显式/隐式标识? 标签、元数据、生成记录与不可恶意删除规则

在中国提供或传播符合适用范围的生成合成图片时,应核对《人工智能生成合成内容标识办法》及配套标准;办法自 2025 年 9 月 1 日起施行,并区分显式和隐式标识。模型元数据、C2PA 或水印可以帮助记录来源,但不能证明你拥有输入素材、人物肖像、商标或最终输出的全部权利。可参考站内生成图片商用验收生成内容六层权利检查的通用方法。

从第一次出图到稳定交付的十道门

  1. 任务门:明确是概念探索、产品图、角色一致、局部修改还是批量 API,以及失败成本。
  2. 来源门:模型、VAE、LoRA、ControlNet、节点与安装包均有官方/可信来源、许可证和哈希。
  3. 环境门:记录硬件、驱动、程序、Python/PyTorch、依赖和可回滚版本。
  4. 输入门:确认参考图、人物、品牌、字体和客户数据的授权、敏感性与保留期限。
  5. 基线门:用冻结 workflow 和至少 12 个真实任务形成失败也保留的基线。
  6. 实验门:单变量比较 seed、steps、guidance、sampler、尺寸或控制强度,不用精选图替代统计。
  7. 质量门:检查主体、数量、文字、身份、结构、边缘、品牌和输出尺寸;高风险内容由人复核。
  8. 权利门:分别核对模型、附加权重、输入、输出近似、人工贡献和渠道条款。
  9. 标识门:按适用法规与平台保存生成记录,添加显式/隐式标识,不恶意移除来源信息。
  10. 运维门:小流量上线,监控失败、返工、单位有效图片成本和版本漂移;更新先 canary 再扩量。

Stable Diffusion 常见问题

零基础应该先学 ComfyUI 还是 AUTOMATIC1111?

如果目标是理解并复用工作流、跟进 SD3.5 等新模型和做批处理,ComfyUI 的节点图更适合作为当前起点;若已有成熟 A1111 插件与旧 SD1.5/SDXL 资产,可先保留旧环境。不要只按界面“好不好看”迁移,应比较模型支持、工作流复现、插件安全、批处理和回滚。

没有 NVIDIA 显卡还能使用吗?

可以考虑 ComfyUI 手动安装支持的 AMD、Intel、Apple Silicon 或其他后端,也可先用云端;但支持列表、PyTorch 构建和性能会变化。以当前系统要求为准,用自己的任务测试,不把 CPU 能启动理解为可接受生产速度。

多少显存才能运行 SD3.5?

没有脱离配置的统一答案。先确定具体模型、精度、文本编码器、分辨率、批量、附加控制和是否 offload,再测峰值显存、RAM、耗时与质量。模型卡的权重大小不是显存承诺。

复制别人的 workflow JSON 就能复现吗?

不能保证。JSON 还依赖相同模型文件、哈希、节点/自定义节点、ComfyUI、Python/PyTorch、输入图片和硬件数值路径。未知 workflow 也可能要求安装会执行代码的节点,先在隔离环境审查。

模型生成的图片自动属于我吗?

不能这样概括。模型许可、输入素材授权、第三方肖像/商标/作品、输出相似性、人工创作贡献、所在地法律和发布平台条款是不同问题。商业项目应逐层留档并由合格专业人士复核。

怎样判断参数调整真的有效?

冻结模型、workflow、任务集和大部分变量,每个条件使用多个 seed;把任务成功、具体错误、人工选择/返工、耗时和资源同时记录。只展示一张最好看的图,不能证明参数稳定提升。

结论:Stable Diffusion 入门的核心不是下载一个“万能整合包”或背一组神奇参数,而是建立可追溯的生成系统:选清模型、界面和部署方式,保存 revision/哈希与 workflow,用真实任务做单变量实验,把质量、资源、输入权利、模型许可和发布标识放进同一验收卡。完成这条闭环后,你得到的不只是第一张图片,而是一套能复现、能回滚、能解释、也更适合持续生产的工作流。