一、介绍1.什么是AIGCAIGCArtificial Intelligence Generated Content人工智能生成内容。是一种利用人工智能技术自动生成内容的技术。AIGC技术通过接收用户的任务指令处理自然语言自动生成图片、视频、音频等内容内容孪生包括智能增强/转译图像超分/语音转字幕内容编辑理解内容/属性控制场景剪辑/虚拟试衣/人声分离内容生成图像/文本/视频/多模态生成2.AIGC应用场景影视行业画质增强/虚拟场景电商行业3D模型/虚拟主播带货/虚拟商城娱乐行业图像融合/风格转换/聊天机器人/互动游戏教育行业教学素材/机构模型/数字化3.AIGC产品生态基础层模型服务预训练模型基础设施api接口专业软件中间层垂直/场景/个性化二次开发/应用模型/工具应用层各种AIGC应用用户需求/产品落地网页/小程序/APP二、图像生成变分自编码器VAEVariational Autoencoder以概率的方式对图像的潜在空间进行观察描述数据生成生成对抗网络GANGenerative Adversarial Networks零和博弈使用广泛生成器和判别器扩散模型Diffusion最流行扩散步骤添加噪声扩散噪声的逆过程2.VAE处理过程通过编码器Encoder Network卷积conv实现特征提取通过高斯分布来描述潜在空间的特征均值和方差编码完成之后去生成图片从潜在空间对每个特征进行采样再经过解码器Decoder latent vector反卷积deconv变成图片VAE的特征VAE是深度生成模型整个网络是一个卷积网络描述潜在空间的概率特征有高应用价值图像经过解码器会有多种特征每次采样的结果不同 生成的图像也不同3.GAN构成GAN网络 由生成器和判别器构成生成器负责生成图片判别器辅助我们判断生成器生成的图片是否逼真生成器通过学习合理的数据判别器去判别输入的数据是生成数据还是真实数据当网络输出越接近于0时生成数据可能性越大当网络输出越接近于1时说明是真实数据的可能性越大也就是说明生成的图片越接近于我们的真实数据处理过程Generator生成器的输入是随机噪声random noiseDiscriminator判别器进行二分类判断这个图片输入进来的是真实的图片还是生成器生成的图片直到判别器把生成的图片也判断成真实的图片那就可以说明生成器生成的图片效果是比较好的就可以用生成器来生成图片4.扩散模型思想扩散模型包括前向过程和反向过程受非平衡热力学的启发用于去噪前向扩散过程图像会被引入的噪声污染将图像逐步引入噪声直到成为完全随机噪声这一过程将噪声逐步扩散到图像的每个像素最终使得图像无法辨识;反向降噪过程通过从高斯噪声中逐步去除噪声还原出源数据的清晰信号提高信号的保真度和可靠性反向过程恢复的是原始图像的变种图像它和原图不是一模一样的处理过程应用图像超分/上色/文本生成图片/全景图像生成三、SD模型原理1.SD介绍SDStable Diffusion4个概念One.扩散模型Diffusion Model文生图算法模型Two.潜在扩散模型Latent Diffusion Model处理过程上面的部分x就是输入的图片它先经过一个编码器之后获取特征相对原始图片维度很小从这个特征上添加噪声生成图片的时候就是它的逆过程下面的部分获取图片上面最右侧添加噪声的特征纯噪声变成了生成图片的输入在生成图片的时候不仅需要存噪声还需要一些条件信息condition这些信息可以是文本/图片反向过程的输入有两个一个是我们添加噪声之后的这个zt;一个是条件条件我们要进行编码用U-Net网络交叉注意力机制进行去噪最终获取一个没有噪声的特征再进行解码最终获取生成的图片对计算资源和内存消耗需求较低图像生成速度也更快Three.SD模型Stable Diffusion使用改进之后的clip模型进行词嵌入Four.SD WebUI模型Stable Diffusion Web UI网页端操作界面通过该系统就可以控制模型出图了✅2.SD特点One.可拓展性拓展性强可免费学习功能丰富精准控制图像分辨率Two.出图效率高本地部署Three.数据安全本地部署安全性高3.SD算法原理图片来源《扩散模型在计算机视觉领域的研究现状》Research status of diffusion models in computer vision管凤旭,张涵宇,路斯棋,赖海涛,杜雪,郑岩…扩散模型在计算机视觉领域的研究现状[J].智能系统学报,2025,20(2):265-282,18.工作原理图像生成基于深度学习进行训练GAN生成对抗模型/VAE变分自动编码器生成的图片很逼真/Flow流模型/Diffusion扩散模型使用最广泛4.SD模型实现Diffusion Model模型实现流程论文Denoising Diffusion Probabilistic Models链接:https://arxiv.org/abs/2006.11239)正向训练阶段Training1.重复这个过程2.从数据当中进行采样采样出来的一个图片叫做x03.从均匀分布中选择一个t它是一个超参数可以自己设置表示下面添加t步噪声4.每次添加的噪声服从标准正态分布最后生成的噪声目标值也是服从标准正态分布的一个高斯分布5.最后的结果是一个高斯分布通过MSE损失来衡量高斯噪声和你往图片当中添加噪声中获取结果之间的差异差异越小越好6.直到模型拟合结束逆向阶段Sampling1.输入是xT(从高斯分布采样服从标准正态分布2.For循环按照从T…1的顺序进行迭代3.生成z服从高斯分布z~N0,1并获取均值和方差4.用这个公式进行去噪5.当z0时结束循环6.返回最终恢复的x05.SD架构Stable Diffusion模型不是单一的一个模型是多个模型组成的运作系统Text Encoder文本编码器把我们输入进来的提示词转化为数值的形式送入到Diffusion模型进行处理UNet网络用于去除噪声Schedule是去除噪声的方式Image Encoder解码器会将Diffusion输出的特征转化成我们想要的RGB图像维度为红绿蓝6.Clip模型由OpenAI提出的一种多模态神经网络借助自然语言的监督来学习视觉通过标注大量的图像标注好之后使用这些数据集来训练我们的模型Clip模型在各种各样的图片上进行训练同时又依赖于互联网上大量自然语言文本的监督使我们训练出来的模型能够适用于各种各样的任务用clip模型来提取prompt提示词文本部分的特征转换成向量嗯进行词嵌入嵌入之后把这些特征送入到我们的图像生成器Diffusion模型当中让模型去理解我们输入提示词的内容文本控制图像生成Clip模型是来做文本和图像匹配的输入N个文本和N张图片一一对应文本输入到Text Encoder文本编码器用Transformer进行文本特征提取文本相对应的图像输入到Image Encoder解码器通过CNN网络构成提取图片特征然后计算Cosine相似度位于对角线上的相似度正样本相对要大一些不在对角线的相似度负样本要相对小一些获取我们的预训练模型即最大化N个正样本的Cosine相似度最小化N2-N个负样本的Cosine相似度Zero-Shot阶段是使用Clip的预训练模型来进行Transfer(零样本学习进行图片分类IE是对图片的一个特征描述7.U-Net网络进行图像分割的神经网络模型用来辅助提取并且训练图像特征左边的部分叫做降采样特征图随着网络结构的加深在不断的变小右边的部分叫做升采样随着网络的处理特征图在不断地变大U-Net网络不会改变输入特征图的大小在Diffusion模型当中设置了去除多少个t步的噪声就去循环多少个U-Net结构8.Schedule定义使用哪种算法来添加噪声定义降噪的步骤是否具备随机性、查找去噪后样本的算法所以它又被叫做采样算法是一个可调节的参数我们可以根据图像的类型和使用的模型选择不同的采样器从而达到一个更好的出图效果