2022 年 8 月,Stable Diffusion 的公开发布让文本生成图像从少数公司的在线演示,迅速变成普通开发者可以下载、修改和部署的模型。很快,Web UI、插件、微调模型和工作流工具大量出现,迭代速度远超单一产品团队。
如果说 DALL·E 2 让大众看见生成图像的可能,Stable Diffusion 则让社区第一次大规模参与这项技术。
为什么“潜空间”很关键
直接在高分辨率像素上进行多轮扩散计算,成本非常高。Stable Diffusion 采用潜在扩散:先用编码器把图像压缩到更小的潜空间,在潜空间完成主要去噪过程,最后再解码回像素。
这项设计在质量和计算量之间取得了实用平衡,使模型可以在消费级 GPU 上运行。技术只有在足够便宜时才会形成生态。能够本地生成,意味着开发者可以批量实验、接入自己的流程,并在一些场景下让数据不离开设备。
文本编码器、U-Net 去噪网络和 VAE 各自负责不同环节,也让后续社区有了可替换的接口。ControlNet、LoRA 等方法之所以能迅速流行,正是因为大家不必每次从头训练整个系统,而能针对结构控制或风格进行较轻量的扩展。
开放带来的不仅是免费
开放权重最直接的好处是可访问,但更深的价值是可组合。有人优化推理速度,有人制作界面,有人训练垂直风格,有人把模型接入 Blender、Photoshop 或游戏管线。一项能力从产品变成了基础组件。
与此同时,风险也从平台集中管理变成了生态共同承担。训练数据的版权、艺术家风格的使用、生成不当内容和深度伪造,都无法只靠一个网站的审核按钮解决。本地可运行意味着更强的个人控制,也意味着更少的中心化约束。
开放不是“没有规则”,而是规则必须从单个平台扩展到模型许可证、数据治理、应用设计和社会规范。
对应用开发者真正有用的是什么
我认为最容易犯的错,是把生成图像 API 当成一个确定性服务。相同提示会得到不同结果,模型升级会改变风格,安全过滤和采样参数也会影响输出。把它接入生产系统时,需要像管理搜索或推荐一样管理概率结果:保存模型版本和参数,建立人工选择环节,对关键内容设置审核,并允许用户追溯来源。
另一个变化是,产品价值不再只由模型大小决定。工作流、领域数据、可控编辑、速度和用户反馈闭环,往往比“底座模型又高了几个指标”更接近真实体验。
我的理解:开放模型把创新从纵向变成横向
封闭服务通常沿一条产品路线向前优化;开放模型会被成千上万的人拉向不同方向。它不一定在每个方向都更安全、更精致,却更容易出现原团队从未设想的用途。
Stable Diffusion 留下的长期启示是:当模型能力逐渐通用,竞争焦点会转向谁能把它嵌进具体流程。对于开发者,理解推理成本、版本可复现、数据边界和人机协作,比只会调用一次生成接口更重要。
参考资料
- Stability AI:Stable Diffusion Public Release
- 论文:High-Resolution Image Synthesis with Latent Diffusion Models
本文是 2026 年整理断更期时写下的回顾,发布日期按事件所处阶段归档。