Stable Diffusion 3.5 — 开源图像生成模型的生态基石
Stable Diffusion 3.5 是 Stability AI 的开源 MMDiT 生图模型家族,Large/Medium/Turbo 三档适配不同硬件,配合 ControlNet、LoRA 与 ComfyUI 生态,是本地部署与私有化定制的首选。
Stable Diffusion 3.5(SD3.5)是 Stability AI 于 2024 年 10 月发布的开源图像生成模型家族,采用多模态扩散 Transformer(MMDiT)架构。它是开源社区事实上的标准底座,配合 ControlNet、LoRA 与 ComfyUI,是本地部署与私有化定制的最强生态。
公司背景
Stability AI 是全球最知名的开源 AI 公司之一,Stable Diffusion 系列自 2022 年发布以来深刻改变了 AI 生图格局。SD3.5 标志着公司在管理层重组后回归「开放、社区驱动」价值观。2026 年初公司被数亿美元收购,开源承诺保持不变。
模型版本
| 版本 | 参数 | 定位 |
|---|---|---|
| SD3.5 Large | 约 8B | 旗舰质量、提示遵循市场领先 |
| SD3.5 Large Turbo | 约 8B | 4 步采样(ADD 蒸馏),速度提升约 8 倍 |
| SD3.5 Medium | 约 2.5B | 消费级 GPU,24GB Apple 芯片可跑 |
核心架构
MMDiT 多模态扩散 Transformer
从传统 UNet 到 Transformer 的跨越:双流注意力让文本与图像各自处理再交叉融合;QK-Normalization 提升训练稳定性;16 通道 VAE 与 Rectified Flow 采样器优化生成路径。Medium 变体采用升级版 MMDiT-X,前 12 层加入双注意力块、前 13 层加入自注意力,多分辨率一致性更强。
三重文本编码器
OpenCLIP-ViT/G + CLIP-ViT/L(77 token)+ T5-XXL(77/256 token),支持复杂语义与长提示词。
多分辨率原生训练
渐进式混合分辨率训练(256→512→768→1024→1440),原生支持 512×512 至 2048×2048,无需超分或平铺。
核心能力
- 文字渲染:短词、短语甚至完整句子可正确拼写(相比 SDXL 质的飞跃)
- 人体解剖:专项数据显著减少手指异常、关节扭曲
- 可控性:Canny 边缘 / Depth 深度 / Blur 模糊三套 ControlNet
- 生态:LoRA(可堆叠)、img2img、inpainting、平铺放大
- 性能优化:NVIDIA TensorRT 协作带来 2.3x 提速、40% 显存下降(Large 19GB→11GB,FP8)
授权与价格
Stability AI Community License:个人与企业年收入 <$100 万免费商用;以上需企业授权。用户拥有生成图版权可商用。本地自部署除硬件外无边际成本;第三方 API 约 $0.003–$0.025/张(Schnell 最低)。
适用场景
- 本地/私有化部署:数据隐私敏感的企业与机构
- 自定义微调:针对特定风格或品类的 LoRA 深度定制
- 批量生产:Turbo 变体极速推理,大吞吐
- 研究与教育:透明、可复现、生态丰富
- 产品可视化:架构渲染、商品图
优缺点
优点
- 开源生态最完整(ComfyUI、A1111、LoRA、ControlNet)
- 可控性与自定义能力最强
- 本地部署无边际成本,隐私可控
缺点
- 动态运动与极端透视仍有短板
- 默认偏饱和高对比色调
- T5 token 超过 256 时出现伪影
- 原生画面质感略逊 Midjourney
常见问题 FAQ
Stable Diffusion 3.5 免费吗?
模型权重开源,个人及年收入低于 100 万美元的企业可免费商用;本地自部署除 GPU 硬件外无额外费用。
SD3.5 需要什么显卡?
Medium 约需 16GB(BF16,24GB Apple 芯片可跑);Large FP8 优化后约 11GB,40 系 RTX 可流畅运行。
SD3.5 和 SDXL 有什么区别?
SD3.5 采用 MMDiT Transformer 架构,文字渲染、人体解剖、提示遵循全面提升;SDXL 是旧 UNet 架构。
总结
SD3.5 是本地部署与深度定制的开源基石。需要私有化、可微调、批量生产的团队,它是 2026 年开源生态中最稳的选择。

