一句话答案:Stable Diffusion 不是一个固定网站或单一“最新版软件”,而是一组可本地或云端运行的图像生成模型。零基础用户应先选定模型身份 + 运行界面 + 部署方式,再用同一 prompt、seed、尺寸和参数生成基线图;确认模型文件来源、许可证、输入素材权利与发布标识后,才适合把结果用于正式内容或商业项目。
Stable Diffusion、模型文件、ComfyUI 和在线平台有什么区别?
Stable Diffusion 通常指 Stability AI 发布或许可的一组图像生成基础模型及其生态。模型负责把文本、潜变量和可选图像条件变成结果;ComfyUI、AUTOMATIC1111 或代码库只是加载模型和组织推理的工具;在线平台则可能托管 Stable Diffusion,也可能使用完全不同的模型。看见相似界面或“SD”字样,不能推断底层版本、许可证或输出权利相同。
早期 Stable Diffusion 建立在潜空间扩散上:图像经 VAE 压缩到潜变量,去噪网络在文本条件下逐步生成,再由 VAE 解码。可核对原始的 Latent Diffusion 论文。SD3/3.5 仍在潜空间生成,但使用 Rectified Flow 与 MMDiT 路线;架构和采样假设不能直接照搬 SD 1.5/SDXL 教程,见 Stable Diffusion 3 论文。
| 名词 | 它是什么 | 实施时必须记录 | 常见误区 |
|---|---|---|---|
| 模型系列 | SD 1.x、SDXL、SD3/3.5 等架构与权重家族 | 仓库、模型卡、revision、许可证 | 把“SD”当成永远相同的模型 |
| Checkpoint | 基础模型、微调或合并后的权重文件 | 文件名、来源页、SHA-256、基础架构 | 只看封面图,不查来源和适配架构 |
| VAE/文本编码器 | 图像潜变量和文本条件相关组件 | 是否内置、独立版本、精度 | 随意混配导致偏色、噪点或加载失败 |
| LoRA/ControlNet | 风格/主体适配或结构条件组件 | 基础模型、权重、触发词、来源和许可 | 认为所有 LoRA 可跨 SDXL/SD3.5 通用 |
| 界面/工作流 | ComfyUI 等推理编排工具及节点图 | 程序版本、节点版本、workflow JSON | 把界面版本当成模型版本 |
| 托管平台 | 供应商代为运行模型的服务 | 实际模型、条款、区域、保留与费用 | 把平台“可下载”当成模型可商用 |
2026 年先选哪个模型?不要把“最新”当成唯一答案
Stability AI 的当前 Core Models 清单列出 Stable Diffusion 3.5 Medium、Large、Large Turbo、SD3 Medium 和部分 Turbo/视频模型。清单会变化,因此正文不把任何一个型号写成永久“最强”。选择取决于工作流生态、文字遵循、速度、显存/内存、许可证和已有资产,而不是年份。
| 候选 | 适合先验证什么 | 官方证据入口 | 不要直接推断 |
|---|---|---|---|
| SD3.5 Large | 复杂提示、排版文字与较新 MMDiT 工作流 | 官方模型卡 | 模型卡示例图等于你的业务效果;权重大小等于显存需求 |
| SD3.5 Large Turbo | 少步数生成与交互速度 | 官方模型卡 | 少步数在所有风格、尺寸和量化方案下都更优 |
| SD3.5 Medium | 较小模型与本地资源折中 | 官方模型卡 | “Medium”必然能在任意消费显卡顺畅运行 |
| SDXL 1.0 | 成熟的社区 checkpoint、LoRA 与控制生态 | SDXL 模型卡 | 生态成熟等于许可清晰或适合所有中文文字任务 |
| SD 1.5 生态 | 必须兼容旧插件、旧 LoRA 或低分辨率资产的遗留项目 | 具体 checkpoint 的模型卡与许可证 | 名称含 SD 1.5 就由 Stability AI 官方维护 |
每个第三方 checkpoint 都是独立供应链对象。即使它基于一个可商用基础模型,也仍要检查作者、训练数据声明、许可证、使用限制和文件哈希。可用站内的信息源与引用核验方法建立模型来源卡;不要从网盘合集、搜索广告或不明启动器下载可执行文件。
云端、ComfyUI Desktop、Portable、手动安装还是 Diffusers?
| 路线 | 适合谁 | 主要优点 | 主要代价/停止线 |
|---|---|---|---|
| 可信云端服务 | 先验证需求、没有合适 GPU、偶尔使用 | 无需维护驱动,按量试错 | 先核对模型身份、数据保留、地区、费用与内容条款;敏感素材不能默认上传 |
| ComfyUI Desktop | Windows + NVIDIA 且希望安装器管理环境的新手 | 环境隔离、图形化节点、迁移入口 | 官方页面仍标注 Beta;实际界面可能变化 |
| ComfyUI Portable | Windows、本地解压运行、需要独立 Python | 目录可搬迁、便于冻结与回滚 | 仅从官方入口下载;更新前备份 workflow 和节点清单 |
| ComfyUI 手动安装 | Linux/AMD/Intel/Apple/特殊加速器或需精确依赖控制 | 硬件路线更灵活 | 需要理解 Python、PyTorch 与驱动;按当前系统要求选择,不复制旧命令 |
| Diffusers/Python | 开发、批处理、API、自动测试和可观测性 | 代码可审计、易集成 | 必须锁定依赖、revision 与生成记录;先看Diffusers Quicktour |
如果目标只是“判断 Stable Diffusion 是否适合我的任务”,先用云端或官方示例跑 12—20 个真实任务,比先买显卡更稳妥。如果需要数据不出本地、反复批量生成、节点级复用或自定义模型,再比较本地方案。可结合本地、云端与混合部署决策和硬件采购证据与验收方法,不要按一张“显存推荐表”直接下单。
安装前检查:显存不是唯一门槛
显存需求随模型、精度、文本编码器、VAE、分辨率、批量、ControlNet/LoRA、注意力实现、offload 和并发变化。模型仓库中 16 GB 的权重文件不表示运行时只需 16 GB 显存,反过来也不能用文件大小断言必须购买某档显卡。Diffusers 内存优化文档也强调,不同 UNet/Transformer 架构对 offload、分片或量化的收益不同。
| 检查项 | 发布前记录 | 最低验收 |
|---|---|---|
| 硬件/驱动 | GPU、显存、RAM、磁盘、OS、驱动与加速后端 | 官方当前支持;不拿“能启动”代替持续稳定 |
| 模型身份 | 仓库、revision、文件 SHA-256、基础架构、许可证 | 来源可追溯;不加载不明 pickle/可执行文件 |
| 运行环境 | ComfyUI commit/release 或 Python、PyTorch、Diffusers 版本 | 与系统 Python 隔离;可导出依赖 |
| 基线任务 | 真实 prompt、尺寸、seed、步数、批量、成功标准 | 连续运行并保存日志、峰值资源、耗时和失败 |
| 回滚 | 旧版本、workflow JSON、节点清单、模型哈希 | 更新失败能恢复,不覆盖唯一工作环境 |
资源不足时,按“减小批量/尺寸 → 关闭附加组件 → 使用模型适配的 offload/分片 → 验证量化质量 → 更换模型或云端”逐级处理。量化并非免费压缩,需参照量化精度、显存与质量验收对业务图像复测。
用 ComfyUI 生成第一张可复现图片
- 只从官方入口安装。按系统要求选择 Desktop、Portable 或手动安装;把下载页面、安装包版本和哈希记入项目记录。
- 选择与模板匹配的模型。先打开模型卡,接受必要的 gated 条款,确认架构、组件、许可证和官方示例工作流;不要把 SDXL workflow 直接换成 SD3.5 checkpoint。
- 加载官方/内置基础模板。ComfyUI 首图指南覆盖模板加载、模型安装和第一次文生图;界面变化时以该页为准。
- 确认六段数据流。Checkpoint/组件加载 → 正向/负向文本条件 → 初始 latent → sampler/scheduler 去噪 → VAE 解码 → 保存图片。
- 固定生成卡。保存模型 revision/哈希、workflow JSON、prompt、negative prompt、seed、尺寸、步数、CFG/guidance、sampler/scheduler、精度、节点版本和时间。
- 生成基线而非“神图”。先用简单、有可判定对象/数量/位置/文字的任务确认链路,再换成业务任务;失败也保存。
- 更新前做回归。官方更新文档区分开发版与 stable 路线;生产环境先复制环境或 canary,不在唯一实例上直接升级。
自定义节点会执行代码,不是“拖进工作流就安全”。安装前检查仓库所有者、提交记录、依赖和权限;能用核心节点完成时先不用自定义节点。ComfyUI 当前的 Manager 安装说明应作为入口,但“能被 Manager 找到”也不等于经过本站安全审计。
建议每次生成至少保存一条文本化记录:项目/任务 ID、模型仓库与 revision、每个权重 SHA-256、ComfyUI/节点版本、workflow JSON 哈希、输入图片哈希、完整 prompt、seed、尺寸、采样设置、输出文件哈希、开始/结束时间、峰值显存/RAM、错误和人工处理。图片元数据可能在压缩或平台上传时丢失,不能作为唯一记录;生成卡应单独存入版本库或受控资产系统,并与最终交付文件一一对应。
Prompt、seed、steps、guidance 和 sampler 应该怎么调?
不要背“万能参数”。不同模型家族和蒸馏版本对 guidance、负向提示词和步数的建议不同。例如Diffusers 的 SD3 pipeline 文档给出当前参数接口,但示例值只是起点,不是适用于所有 checkpoint 的最佳值。
| 变量 | 它控制什么 | 正确实验 | 错误做法 |
|---|---|---|---|
| Prompt | 主体、动作、环境、构图、媒介、光线和约束 | 先写可验证内容,再加风格;记录准确文本 | 堆几十个互相冲突的“高质量词” |
| Negative prompt | 部分模型/工作流的排除条件 | 先看模型卡;逐项验证是否有用 | 把旧版负面词整段复制到所有模型 |
| Seed | 随机初始状态的重要输入 | 同环境固定 seed 做单变量对照 | 认为 seed 可跨 GPU/PyTorch/节点保证逐像素一致 |
| Steps | 去噪/流匹配迭代次数 | 按模型建议设低、中、高三档,看收益是否饱和 | 步数越多必然越清晰 |
| Guidance/CFG | 文本条件影响强度 | 围绕模型卡建议做小范围扫描 | 越高越听话且没有画质代价 |
| Sampler/scheduler | 迭代轨迹和噪声/时间步调度 | 其余变量固定,比较失败类型和耗时 | 用名字判断谁“绝对最好” |
| 尺寸/批量 | 构图空间、资源和吞吐 | 从模型建议分辨率起步,分别测单图与并发 | 直接要求原生 4K 或用放大后尺寸冒充原生 |
更可靠的首轮实验是 12 个真实任务 × 每项 3 个 seed。先冻结模型与 workflow,只改变一个变量;同时记录任务成功、主体/数量/文字错误、人工选择时间、峰值显存、端到端耗时和失败。选出候选后再扩大样本。Diffusers 可复现性说明提醒,跨平台和不同 PyTorch 版本不能保证完全复现,因此目标应是可解释回归,而不是承诺任何机器像素一致。
什么时候用文生图、图生图、局部重绘、ControlNet 或 LoRA?
| 任务 | 优先路线 | 必须保留的证据 | 独立风险 |
|---|---|---|---|
| 从概念探索画面 | 文生图 + 多 seed 候选 | prompt、模型、参数、筛选标准 | 把偶然好图包装成稳定能力 |
| 保留参考图构图/色调 | 图生图,逐级测试 denoise/strength | 参考图来源、授权、强度和输出差异 | 无权上传客户、人物或受保护作品 |
| 修正局部对象 | 局部重绘 + mask + 上下文 | 原图、mask、修改 prompt 和版本 | 边缘/身份漂移及未披露实质修改 |
| 控制姿态、深度、边缘 | 适配当前架构的 ControlNet/adapter | 预处理器、控制权重、强度、来源 | 控制模型和基础模型不兼容 |
| 稳定主体/产品/风格 | 有权数据训练或使用 LoRA | 训练集权利、caption、基础模型、训练配置和许可 | 肖像、商标、角色、艺术家风格与数据泄漏 |
| 批量生产 | 版本化 workflow/API + 人工质量门 | 输入清单、失败、成本、审批和回滚 | 只统计出图数,不统计返工与权利失败 |
通用指南只负责路由,不把这些专项任务压缩成几段“高级技巧”。LoRA、ControlNet、局部重绘和放大应各自有可复现、经过复核的独立教程;在对应旧页面完成 A/B 级整改前,本页不把它们作为可靠下一步推荐。
常见报错如何定位?
| 症状 | 先查 | 处理顺序 | 停止线 |
|---|---|---|---|
| 模型不显示 | 文件路径、扩展名、模型扫描日志 | 按官方目录放置、刷新/重启、检查额外模型路径 | 来源不明或需要运行未知安装器 |
| 加载 shape/key 错误 | 基础架构、workflow 节点、VAE/文本编码器 | 回到模型卡官方示例,撤掉附加组件 | 靠忽略大量 missing/unexpected keys 继续生产 |
| CUDA/显存不足 | 峰值显存、分辨率、批量、附加模型和精度 | 减批量/尺寸,关闭控制组件,再做适配的 offload/量化 | 系统频繁崩溃或输出质量未经复测 |
| 黑图/纯噪声/偏色 | VAE、精度、模型组件、数值溢出和输出范围 | 跑官方最小 workflow,逐项恢复自定义节点 | 无法在干净环境复现基线 |
| 文字/手部/数量失败 | 任务是否超出模型稳定边界 | 拆任务、提供结构条件、局部修复或人工编辑 | 对外承诺“精准文字/绝不畸形” |
| 更新后 workflow 失效 | ComfyUI、节点、Python/PyTorch 和模型 diff | 回滚 canary,固定版本逐项升级 | 唯一环境、无 JSON/依赖备份 |
| 同 seed 结果变化 | 硬件、PyTorch、精度、节点、sampler 和输入元数据 | 比较生成卡,定义感知/任务容差 | 把跨环境逐像素一致写进交付承诺 |
“模型允许商用”不等于图片可以放心商用
Stability AI 当前许可证页面按 Core Models、用途和组织年收入区分 Community 与 Enterprise 条件;基础模型、第三方 checkpoint、LoRA、界面、云平台和输入素材可能分别适用不同条款。Stability AI 的可接受使用政策还适用于自托管权重。实施前应保存当日条款,不把本文当法律意见。
| 权利层 | 要问什么 | 最低留档 |
|---|---|---|
| 基础模型 | 该具体版本是否在当前许可范围,商业门槛和分发义务是什么? | 模型卡、许可证正文、访问日期、组织适用结论 |
| 微调/LoRA/节点 | 作者是否有权授权,是否另有限制或代码许可证? | 来源页、作者、license、哈希、依赖清单 |
| 输入素材 | 照片、肖像、商标、角色、字体和客户数据是否允许上传、改编和发布? | 权属、同意、用途、期限、地域和删除要求 |
| 输出 | 是否近似第三方作品/人物/品牌,是否需要人工创作贡献和声明? | 相似性复核、人工编辑记录、审批人和渠道规则 |
| 发布标识 | 发布地、平台和业务角色要求哪些显式/隐式标识? | 标签、元数据、生成记录与不可恶意删除规则 |
在中国提供或传播符合适用范围的生成合成图片时,应核对《人工智能生成合成内容标识办法》及配套标准;办法自 2025 年 9 月 1 日起施行,并区分显式和隐式标识。模型元数据、C2PA 或水印可以帮助记录来源,但不能证明你拥有输入素材、人物肖像、商标或最终输出的全部权利。可参考站内生成图片商用验收和生成内容六层权利检查的通用方法。
从第一次出图到稳定交付的十道门
- 任务门:明确是概念探索、产品图、角色一致、局部修改还是批量 API,以及失败成本。
- 来源门:模型、VAE、LoRA、ControlNet、节点与安装包均有官方/可信来源、许可证和哈希。
- 环境门:记录硬件、驱动、程序、Python/PyTorch、依赖和可回滚版本。
- 输入门:确认参考图、人物、品牌、字体和客户数据的授权、敏感性与保留期限。
- 基线门:用冻结 workflow 和至少 12 个真实任务形成失败也保留的基线。
- 实验门:单变量比较 seed、steps、guidance、sampler、尺寸或控制强度,不用精选图替代统计。
- 质量门:检查主体、数量、文字、身份、结构、边缘、品牌和输出尺寸;高风险内容由人复核。
- 权利门:分别核对模型、附加权重、输入、输出近似、人工贡献和渠道条款。
- 标识门:按适用法规与平台保存生成记录,添加显式/隐式标识,不恶意移除来源信息。
- 运维门:小流量上线,监控失败、返工、单位有效图片成本和版本漂移;更新先 canary 再扩量。
Stable Diffusion 常见问题
零基础应该先学 ComfyUI 还是 AUTOMATIC1111?
如果目标是理解并复用工作流、跟进 SD3.5 等新模型和做批处理,ComfyUI 的节点图更适合作为当前起点;若已有成熟 A1111 插件与旧 SD1.5/SDXL 资产,可先保留旧环境。不要只按界面“好不好看”迁移,应比较模型支持、工作流复现、插件安全、批处理和回滚。
没有 NVIDIA 显卡还能使用吗?
可以考虑 ComfyUI 手动安装支持的 AMD、Intel、Apple Silicon 或其他后端,也可先用云端;但支持列表、PyTorch 构建和性能会变化。以当前系统要求为准,用自己的任务测试,不把 CPU 能启动理解为可接受生产速度。
多少显存才能运行 SD3.5?
没有脱离配置的统一答案。先确定具体模型、精度、文本编码器、分辨率、批量、附加控制和是否 offload,再测峰值显存、RAM、耗时与质量。模型卡的权重大小不是显存承诺。
复制别人的 workflow JSON 就能复现吗?
不能保证。JSON 还依赖相同模型文件、哈希、节点/自定义节点、ComfyUI、Python/PyTorch、输入图片和硬件数值路径。未知 workflow 也可能要求安装会执行代码的节点,先在隔离环境审查。
模型生成的图片自动属于我吗?
不能这样概括。模型许可、输入素材授权、第三方肖像/商标/作品、输出相似性、人工创作贡献、所在地法律和发布平台条款是不同问题。商业项目应逐层留档并由合格专业人士复核。
怎样判断参数调整真的有效?
冻结模型、workflow、任务集和大部分变量,每个条件使用多个 seed;把任务成功、具体错误、人工选择/返工、耗时和资源同时记录。只展示一张最好看的图,不能证明参数稳定提升。
结论:Stable Diffusion 入门的核心不是下载一个“万能整合包”或背一组神奇参数,而是建立可追溯的生成系统:选清模型、界面和部署方式,保存 revision/哈希与 workflow,用真实任务做单变量实验,把质量、资源、输入权利、模型许可和发布标识放进同一验收卡。完成这条闭环后,你得到的不只是第一张图片,而是一套能复现、能回滚、能解释、也更适合持续生产的工作流。
