Stable Diffusion 3.5 — 开源图像生成模型的生态基石

Stable Diffusion 3.5 — 开源图像生成模型的生态基石

Stable Diffusion 3.5 是 Stability AI 的开源 MMDiT 生图模型家族,Large/Medium/Turbo 三档适配不同硬件,配合 ControlNet、LoRA 与 ComfyUI 生态,是本地部署与私有化定制的首选。

Stable Diffusion 3.5(SD3.5)是 Stability AI 于 2024 年 10 月发布的开源图像生成模型家族,采用多模态扩散 Transformer(MMDiT)架构。它是开源社区事实上的标准底座,配合 ControlNet、LoRA 与 ComfyUI,是本地部署与私有化定制的最强生态。

公司背景

Stability AI 是全球最知名的开源 AI 公司之一,Stable Diffusion 系列自 2022 年发布以来深刻改变了 AI 生图格局。SD3.5 标志着公司在管理层重组后回归「开放、社区驱动」价值观。2026 年初公司被数亿美元收购,开源承诺保持不变。

模型版本

版本参数定位
SD3.5 Large约 8B旗舰质量、提示遵循市场领先
SD3.5 Large Turbo约 8B4 步采样(ADD 蒸馏),速度提升约 8 倍
SD3.5 Medium约 2.5B消费级 GPU,24GB Apple 芯片可跑

核心架构

MMDiT 多模态扩散 Transformer

从传统 UNet 到 Transformer 的跨越:双流注意力让文本与图像各自处理再交叉融合;QK-Normalization 提升训练稳定性;16 通道 VAERectified Flow 采样器优化生成路径。Medium 变体采用升级版 MMDiT-X,前 12 层加入双注意力块、前 13 层加入自注意力,多分辨率一致性更强。

三重文本编码器

OpenCLIP-ViT/G + CLIP-ViT/L(77 token)+ T5-XXL(77/256 token),支持复杂语义与长提示词。

多分辨率原生训练

渐进式混合分辨率训练(256→512→768→1024→1440),原生支持 512×512 至 2048×2048,无需超分或平铺。

核心能力

  • 文字渲染:短词、短语甚至完整句子可正确拼写(相比 SDXL 质的飞跃)
  • 人体解剖:专项数据显著减少手指异常、关节扭曲
  • 可控性:Canny 边缘 / Depth 深度 / Blur 模糊三套 ControlNet
  • 生态:LoRA(可堆叠)、img2img、inpainting、平铺放大
  • 性能优化:NVIDIA TensorRT 协作带来 2.3x 提速、40% 显存下降(Large 19GB→11GB,FP8)

授权与价格

Stability AI Community License:个人与企业年收入 <$100 万免费商用;以上需企业授权。用户拥有生成图版权可商用。本地自部署除硬件外无边际成本;第三方 API 约 $0.003–$0.025/张(Schnell 最低)。

适用场景

  • 本地/私有化部署:数据隐私敏感的企业与机构
  • 自定义微调:针对特定风格或品类的 LoRA 深度定制
  • 批量生产:Turbo 变体极速推理,大吞吐
  • 研究与教育:透明、可复现、生态丰富
  • 产品可视化:架构渲染、商品图

优缺点

优点

  • 开源生态最完整(ComfyUI、A1111、LoRA、ControlNet)
  • 可控性与自定义能力最强
  • 本地部署无边际成本,隐私可控

缺点

  • 动态运动与极端透视仍有短板
  • 默认偏饱和高对比色调
  • T5 token 超过 256 时出现伪影
  • 原生画面质感略逊 Midjourney

常见问题 FAQ

Stable Diffusion 3.5 免费吗?

模型权重开源,个人及年收入低于 100 万美元的企业可免费商用;本地自部署除 GPU 硬件外无额外费用。

SD3.5 需要什么显卡?

Medium 约需 16GB(BF16,24GB Apple 芯片可跑);Large FP8 优化后约 11GB,40 系 RTX 可流畅运行。

SD3.5 和 SDXL 有什么区别?

SD3.5 采用 MMDiT Transformer 架构,文字渲染、人体解剖、提示遵循全面提升;SDXL 是旧 UNet 架构。

总结

SD3.5 是本地部署与深度定制的开源基石。需要私有化、可微调、批量生产的团队,它是 2026 年开源生态中最稳的选择。

标签ai图片ai制图ai做图软件