什么是 Diffusion Model?图片视频生成模型全网最详细介绍 ✍ snowboat🕐 2026-06-02📦 58.2 KB 🟢 已读 𝕏 文章列表 本文详细介绍了AI图像与视频生成背后的核心技术——扩散模型(Diffusion Model)。文章通过通俗易懂的语言,解释了其物理起源、从加噪到去噪的运作原理,以及它如何凭借稳定性优势逐渐取代GAN成为生成式AI的主流范式。 Diffusion ModelAIGC机器学习图像生成深度学习原理科普 # 什么是 Diffusion Model?图片视频生成模型全网最详细介绍 **作者**: snowboat **日期**: 2026-06-02T00:01:07.000Z **来源**: [https://x.com/snowboat84/status/2061598950944305295](https://x.com/snowboat84/status/2061598950944305295) ---  今天几乎所有AI生成的图像和视频,背后跑的都是同一类技术:Diffusion Model(扩散模型)。Midjourney、Veo、FLUX、Imagen、可灵、Runway,核心算法都是它。 它的运作方式说起来很奇怪:模型先生成一团完全随机的噪音,然后一步步把噪音"去掉",最后剩下的就是一张图。从噪音里"减"出图听起来像炼丹术,但2026年你刷到的几乎所有AI生成图和视频,都是这么来的。 这套机制的数学骨架来自100多年前的物理学。19世纪植物学家Robert Brown在显微镜下看到花粉在水里漂移,20世纪初Einstein和Langevin把这个现象写成方程,2015-2020这五年被一批研究者搬进AI,几年时间成了今天图像视频生成的主导范式。 几乎每个人都用过上面列举的图像和视频生成工具里的一个或者几个。但要让普通用户说清楚原理,多数答案停在"AI画的""神经网络生成的"这一层。再问深一点,名词开始往外蹦:扩散、去噪、UNet、Transformer、DiT、latent space。知道的人就很少了。 这篇文章把扩散模型这条线,从一堆名词理成一条清楚的主线,让普通人可以理解图像和视频生成背后的模型。 上一篇《一篇文章讲清大语言模型发展史》讲了文字这条线。这一篇讲图像和视频那条线。文字这条线的核心是"猜下一个词",图像这条线是"擦掉噪点",机制完全不同。但两条线最后都在Transformer这块共同的积木上汇合。  # 一、它从哪来:一个生物物理博士的冷门想法(2015) 要理解扩散模型为什么是今天这个样子,要从它出生时的舞台开始。那时舞台属于另一个网红:GAN。 ## 1.1 在它之前,舞台属于 GAN 2014年6月,蒙特利尔大学博士生Ian Goodfellow发表了一篇论文,题目叫《Generative Adversarial Networks》,投进了那年的NIPS。这篇论文提出了一个看起来像智力游戏的想法:用两个神经网络互相对抗来生成图像。  Ian Goodfellow 一个网络叫"生成器"(generator),任务是造假图。从噪声向量开始,造出一张看起来像真照片的图。另一个网络叫"判别器"(discriminator),任务是当警察。看到一张图就判断这是真照片还是生成器造的。两个网络对抗训练,生成器拼命提升骗术,判别器拼命提升识别能力。理论上跑到最后,生成器造出的图判别器分不出真假,那就成了。 这套思路漂亮在哪?传统上想生成一张图,要直接学习"什么样的像素组合是真图"的概率分布,数学上写不下来,更算不出来。Goodfellow绕开了这个老大难,把它转化成两个网络的博弈,训练只需要分类损失。论文一发表整个圈子被点燃。  接下来五年是GAN的天下。2018年英伟达推出StyleGAN,生成的人脸照片骗过了普通人,那个网站thispersondoesnotexist.com火了一阵,每刷新一次出来一张不存在的人脸。2019年Google的BigGAN把生成质量推到新高度,能生成1024x1024分辨率的鸟、狗、风景,FID(Frechet Inception Distance,图像质量评价指标)大幅领先。 在那段时间,"生成模型"在AI研究者心里几乎等于"GAN的变体"。GAN虽然漂亮,但有几个出名的毛病。一是训练极不稳定,生成器和判别器要保持微妙的平衡,稍微不平衡就崩。两个网络对抗像走钢丝,很多研究员训了几个月没结果。二是"模式崩溃"(mode collapse),生成器找到一种能骗过判别器的图就反复造同款,比如训练用了100种狗的图,生成器最后只会造三种狗。三是没有显式的概率密度,导致评估和数学分析都不顺手。 这就是2015年扩散模型出现时的大背景。GAN正当红,所有人都涌过去卷。 ## 1.2 一个借自热力学的点子 2015年3月,arXiv上传了一篇论文,题目叫《Deep Unsupervised Learning using Nonequilibrium Thermodynamics》(《用非平衡热力学做深度无监督学习》),第一作者Jascha Sohl-Dickstein,当时在Stanford做visiting scholar。这篇论文后来正式发表在机器学习顶会ICML 2015,是今天扩散模型的奠基论文。  核心比喻来自物理。一滴墨水滴进一杯清水里,会自发扩散,几分钟后整杯水变成均匀的灰色。这是个"有序到无序"的过程,简单,必然,符合热力学第二定律。 那反过来呢?如果能学会把这杯灰水重新聚回成一滴墨水,是不是就有了生成能力?从无序回到有序,从噪声回到结构,从纯随机回到一张具体的图。 这就是扩散模型的基本思路。给一张猫的真照片,一步步加噪声,几百步之后变成纯电视雪花。这个加噪过程是固定的,不需要学习,按物理公式直接写出来。然后训练一个神经网络让它学会逆过程:给一张带噪的图,猜出加上去的噪声是什么,从而擦掉一层。如果网络真的学会了这个逆过程,那从纯雪花开始反复擦,理论上能擦出一张真图。 "扩散模型来自物理"不是事后附会的比喻。Sohl-Dickstein本人就是物理出身。他在UC Berkeley的Redwood理论神经科学中心读生物物理博士,2012年在Bruno Olshausen实验室拿到学位。读博前他在NASA的Mars Exploration Program工作,做火星车上的尘埃动力学研究,发表过专门讨论Mars Exploration Rover全景相机灰尘沉积的论文。一个在NASA研究尘埃落定的物理博士,后来把"墨水扩散"这个物理过程倒过来用在了AI上。 Sohl-Dickstein的这条路径在AI研究里挺孤独的。当时主流是Hinton、LeCun、Bengio那一脉的深度学习,从Boltzmann机到CNN到GAN,思想根子在统计学和神经科学。Sohl-Dickstein的工作明显带着统计物理痕迹,他后来又写过用拉普拉斯-贝尔特拉米算子(黎曼几何里的微分算子)做训练的论文,整体气质是"统计物理博士搬到机器学习领域继续干活"。 补充一点。这位发明人后来从Google Brain和Google DeepMind转去了Anthropic,当Member of Technical Staff。他个人网站上写:最近加入了Anthropic。我每次用Claude的时候会想起这事:Claude背后那家公司里坐着扩散模型的发明人。 ## 1.3 它出来不是为了打败 GAN 2015年这篇论文出来时,作者的动机并不是和GAN抢生意。 读Sohl-Dickstein论文的引言能看出来,他想解决的是一个理论问题。机器学习里有个老大难:怎么用足够灵活的概率分布族描述复杂数据,同时还能保证训练目标可计算、采样可执行、推断可分析。直接对真实图像分布建模太难,因为没有解析形式。VAE通过变分下界绕开了这个问题,但代价是模糊。GAN通过博弈绕开了这个问题,但代价是不稳定。 扩散模型给出了第三条路:把复杂分布的建模任务拆解成几百步简单分布的链。每一步只学一个高斯分布的转移概率,每一步的数学都很干净,不需要变分近似,不需要博弈。整体训练目标是一个标准的负对数似然下界,写得清清楚楚。  Sohl-Dickstein 这个思路在数学家眼里很迷人。但代价直接体现在2015年那篇论文的结果上:生成质量远不如同期GAN,速度慢得离谱(一张图要采样几百到几千步),实用价值看起来很弱。论文发出去之后没几个团队跟进。 Sohl-Dickstein2015年那篇论文当时引用数缓慢爬升,要到2020年DDPM(Denoising Diffusion Probabilistic Models)出来之后才大幅起飞。一个2015年提出的好想法在2020年才被工业界认真当回事,中间隔了整整五年。这五年是扩散模型的冷板凳时刻。 ## 1.4 沉默的五年:为什么没火(2015–2019) 讲第一个反差。扩散模型的思想出来时紧跟GAN,2015年就有了奠基论文,但整整沉默五年没人理。  为什么?主要有三条原因。 最直接的一条是效果不够看。2015年那篇论文里展示的生成结果是CIFAR-10(32x32的小图)和小幅人脸库,画面糊得离谱。同期GAN已经在更大的图上跑出能看的结果,DCGAN(2015年下半年Radford等人发的GAN改进版)生成的卧室、人脸已经有相当的细节。两边一对比,扩散模型像玩具。 第二条是太慢。扩散模型一张图要采样几百到几千步去噪,每一步都要过一遍完整的神经网络,比GAN慢两到三个数量级。GAN一步出图,扩散要几百步。在GPU还没那么富裕的2015到2019年,这种采样开销让扩散模型几乎不能落进任何实际产品。 第三条是没人信这条路。机器学习圈的研究方向有很强的"跟风"效应。GAN出来后,2014到2019年是GAN年代,顶会论文里GAN变体一年几百篇,做衣服、做人脸、做迁移、做超分辨率,研究生选题大多围绕GAN展开。扩散模型这一脉太冷门,只有Sohl-Dickstein和零星几个团队继续做。 在这五年里,扩散模型没死,但活得很边缘。2019年Yang Song和Stefano Ermon在Stanford发了一篇《Generative Modeling by Estimating Gradients of the Data Distribution》,用score matching的视角重新表述了扩散模型,理论上把它和其他能量模型连起来。这篇论文很重要,但当时也没在工业界引起大反响。 这段冷藏期里发生了一个有意思的副作用。GAN自己慢慢撞到了天花板。BigGAN 2019年发出来之后,生成质量提升变得很慢,模式崩溃和训练不稳定的问题越来越凸显。研究者开始觉得GAN这套对抗范式可能到顶了,开始留意有没有别的路径。 舞台准备好了一个翻盘的机会。但要等到2020年。 # 二、原理:它到底怎么"无中生有" 这一章是全篇的地基,写得最慢、最细。讲完这一章,你会对扩散模型这个东西有一个直觉性的整体感受。后面讲它怎么发展、怎么变形、怎么长大,都建立在这一章的基础上。 我用一只猫贯穿讲完整个过程。从加噪到去噪到生成,主角始终是这只猫,方便你跟着画面理解每一步。 ## 2.1 与其学"画图",不如学"擦噪点" 先建立一个关键的换框架视角。 直接从一张白纸画出一只栩栩如生的猫,对神经网络来说很难。要决定整张图的全局结构:猫在画面中心还是边缘、姿势是坐着还是趴着、毛色花纹怎么分布。每个像素值都要由网络一次性吐出来。这套任务太难,GAN花了多年才勉强能做。 换个任务。给你一张已经有点花的猫照片,上面撒了一些噪点,让你把它擦干净一点。这件事简单得多。你不需要决定全局结构,结构已经在图里了,只要把噪点擦掉一层。 扩散模型的核心点子,就是把"造图"这件难事拆成无数次"擦干净一点点"。每一步只擦一点点噪点,做几百步累计的擦除,从纯雪花一路擦到一张清晰的猫。每一步只做一个简单决定,整套流程做一件复杂的事。 这个换框架的本质,是把"一次性大决定"拆成"几百次小决定"。每个小决定都更简单、更稳定、更容易学。代价是慢,要做几百步。但慢恰恰带来了稳定。  ## 2.2 前向过程(加噪):这步不用学 先讲怎么把猫破坏成噪声。这步是固定的,不用学习。 拿一张真猫的照片,假设是512x512分辨率的彩色图。第一步往这张图上撒一点点高斯噪点。所谓高斯噪点,就是每个像素值都加上一个从均值为0、方差很小的正态分布里采样出来的随机数。这一步加得很轻,几乎看不出差别,猫照片基本完好,只是稍微模糊一点。 下一步在前一步基础上再撒一点噪点。再下一步继续。一直撒下去,撒一两百步甚至一两千步。每一步加的噪点幅度按一个预先设定的"噪声调度"(noise schedule)来,通常前期加得轻、后期加得重,整体保证最后一步过后的图像方差趋近于纯标准正态分布。 撒到最后一步,图像看起来就是一张纯电视雪花,跟原来那只猫已经没有任何视觉关系。从信息论的角度看,原图的所有结构信息都被噪声淹没了。 这个过程的关键性质是:每一步都可以用一个简单的概率公式描述。给定前一步的图像x{t-1},下一步x_t就是x{t-1}乘上一个系数加上高斯噪声。这是一个马尔可夫链,每一步只依赖上一步。整个过程不需要学习任何参数,纯粹按公式往原图上叠噪声。 实务上有一个数学便利:因为每一步加的都是高斯噪声,几步累加之后仍然是高斯,所以可以一步从原图直接跳到任意第t步的噪声图,不用真的一步步累加。这个性质让训练的时候可以随机采样任意时间步t,直接拿到对应的噪声图,效率很高。  ## 2.3 反向过程(去噪):这步才是要训练的 加噪那步不用学,反过来擦噪点才是真要训练的活。 任务定义很简单:训练一个神经网络,输入是一张当前带噪的图像和当前的时间步t(告诉它这张图大概在去噪过程的哪个阶段),输出是它对"这张图里加进去的噪声长什么样"的预测。如果它能准确预测出噪声,那从带噪图里减去这份噪声,就能得到稍微干净一点的图。 训练流程是这样的: 1. 从训练集里随机抽一张真图,假设是一张猫 2. 随机选一个时间步t,比如t=500(总共1000步的话,这就是中间位置) 3. 按前向过程的公式,往这张猫上加500步噪声,得到一张带噪的猫 4. 把这张带噪的猫和t=500喂给网络,让它预测加了什么噪声 5. 拿网络的预测和"我们刚才自己加的那个噪声"比对,算出误差 6. 根据误差反向传播,更新网络参数 关键的地方在于:因为加噪过程是我们自己做的,我们手里有"标准答案"。网络的任务就是看着带噪图猜出标准答案。猜对了奖励,猜错了修正。这是一个标准的监督学习问题,损失函数是简单的均方误差,训练目标极其稳定。 这跟GAN完全相反。GAN没有标准答案,只有一个判别器在打分,整套训练是博弈。扩散模型有标准答案,训练是回归。回归比博弈稳定一万倍,这是扩散模型后来打败GAN最根本的工程优势。 实务上一次训练循环要跑几亿到几百亿步。每一步随机抽一张图、随机抽一个时间步、加噪、让网络预测、算损失、更新参数。重复亿次之后,网络脑子里就装下了"任何带噪图像应该怎么往真图方向擦"这套规律。  ## 2.4 逆过程为什么可能?靠"练出来的记忆" 读者读到这里通常有一个最大的卡点:从一张纯雪花理论上能退出任何东西,凭什么退出一只猫?凭什么不退成一只狗、一辆车、一段电视雪花? 答案是:去噪网络在训练时看过几百万到几亿张真图,脑子里有"真实图像该长什么样"的统计规律。它是带着规律擦的,每一步都有方向。 举个具体例子。假设给网络一张几乎全是噪声、隐约能看出中间有一个比四周稍亮的椭圆区域的图。网络的训练数据里有几百万张图,它见过类似的"中间有一个浅色椭圆"的图大多数后来发展成什么。可能是一张脸,可能是一只猫的脑袋,可能是一个气球。它的输出会偏向这几种可能性的均值方向,把那个椭圆推得稍微清晰一点、对称一点。下一步如果浅色椭圆继续往脸的方向发展,两边出现一对深色对称的点(像眼睛),网络又会进一步往脸或动物的方向推。 这种逐步收敛的过程像走山路。最开始你站在山顶(纯噪声),周围全是可能的下山路径。每走一步,根据你脚下的地形(当前带噪图里隐含的微弱结构)选一个方向。走着走着路径越来越窄,最终汇聚到一个具体的目的地(一张具体的猫)。 为什么能学到这些规律?因为训练数据足够多。LAION-5B这种公开数据集有50亿张图文对,扩散模型在这种规模的数据上训练时,相当于把"自然图像的统计规律"压进了网络参数里。每个参数都在编码"什么样的像素组合更像真图"这个信息。 这里有一个深层的认知点:扩散模型不把训练集里的图存下来,而是把"真实图像的规律"压进了参数。Stable Diffusion 1.5的去噪网络大约8.6亿参数(约4GB),训练数据是LAION-2B(约23亿张图)。8.6亿参数装23亿张图,平均每张图只摊到不到4字节,根本存不下原图。它存下的是规律,不是图。 这跟LLM是同一个道理。GPT把文本里的规律压进参数,扩散模型把图像里的规律压进参数。两者都是"用神经网络压缩世界的统计规律"。读完上一篇LLM那篇文章再回头看,这个对应关系很清晰。  ## 2.5 生成:雪花一步步长出猫 训练好之后,怎么用这个网络从空白生成一只猫? 第一步,采样一张纯高斯噪声图,512x512的随机雪花。设t=1000(去噪过程的起点)。 第二步,把这张噪声图和t=1000喂给网络,网络预测当前噪声里"应该被擦掉的"噪声分量。从输入图里减去这份预测(按一定系数),得到一张稍微清晰一点的图。设t=999。 第三步,重复第二步,把新的图和新的t喂给网络,再擦一层。t=998。 如此循环,t从1000一路降到0。每一步擦一点,每一步图像稍微清晰一点。看视觉效果像延时摄影: - t=1000时是纯雪花,什么都看不出 - t=800时雪花里隐约出现一些低频暗影 - t=500时大致能看出有一个椭圆形的物体在画面中央 - t=300时椭圆开始有边缘轮廓,能看出大致是动物 - t=100时毛色、眼睛、耳朵都出来了 - t=0时一只清晰的猫,看起来像真的 每一步只做一点点决定。但累计起来,从纯雪花长出了一张猫。 这里有一个关键体会:初始的随机雪花决定了最后会长成什么。因为擦的过程对网络来说是确定性的(给定网络),雪花里那些极其微弱的随机苗头会被网络逐步放大,最终决定整张图的全局结构。换一张雪花就长出一只完全不同的猫。同一个模型能造出无数张不同的图,所有差异都来自最初那张随机种子。 这个性质有个工程后果。Stable Diffusion有一个seed参数,输入同一个prompt加同一个seed,每次出图都一模一样。改一下seed,图就不一样。seed就是控制初始噪声的随机种子。我刚开始玩SD的时候,经常固定seed反复调prompt,因为这样能保证我看到的变化都来自prompt而不是噪声本身,更容易调参。  ## 2.6 为什么"拆成几百步"反而更好 到这里你应该看出来一个有意思的对比。GAN想一步到位,给生成器一个噪声向量直接吐出整张图。扩散模型偏要拆几百步,慢慢擦。 慢看起来是缺点。但慢恰恰是扩散模型后来打败GAN的关键。 拆成小步之后,每一步的任务都简单。前面提过,"擦掉一层薄噪点"远比"从一片空白画出整张图"容易。神经网络在简单任务上更容易学好,训练目标是回归,损失函数稳定,没有博弈。这是扩散模型训练稳定、不会模式崩溃的根源。 拆成小步之后,每一步都能注入控制信号。"我想要橘色的猫"这个文字prompt会在去噪的每一步都喂给网络,让它逐步把图往"橘色"的方向调。这种"每步可控"的性质天然适合做条件生成(text-to-image、image-to-image、inpainting),GAN这种一步到位的架构很难做到。  拆成小步之后,质量上限也变高。GAN一步出图,所有问题要一次性解决,能力被压在一个网络里。扩散用几百步分步解决,每一步只解决局部小问题,整体能逼近的目标分布更精细,理论上没有明显的上限。 这一章讲完了"是什么"和"为什么"。下一章讲它的命运转折。 # 三、转折:DDPM 让它一夜翻身(2020) 讲第二个反差。2015年的扩散模型生成质量糊得不能看,五年后突然能跟GAN掰手腕,靠的是什么?答案是一篇2020年的论文,名字叫DDPM。 ## 3.1 DDPM 改了什么 2020年6月19日,UC Berkeley的博士生Jonathan Ho(Ho的导师是Pieter Abbeel,强化学习领域的知名学者)和Ajay Jain、Pieter Abbeel在arXiv上传了一篇论文,题目叫《Denoising Diffusion Probabilistic Models》,简称DDPM。这篇论文当年发表在NeurIPS 2020。  DDPM并没有推翻Sohl-Dickstein 2015年的理论框架。整套加噪去噪的数学骨架照搬过来。它做的是工程上的两步关键简化。 第一步简化是训练目标。2015年那篇论文的训练目标是变分下界(ELBO),数学上严谨,但写出来是几个项相加,每一项的权重要小心调,损失函数有点麻烦。DDPM论文给出了一个新视角:与其去拟合"图像的概率分布",不如直接让网络预测"加进去的噪声"。这两件事在数学上是等价的,但训练目标从复杂的ELBO直接退化成一个最简单的均方误差,损失函数就是网络预测的噪声和真实噪声之间的差的平方。简单到一句loss = mse(pred_noise, true_noise)就能写完。 第二步简化是参数化方式。DDPM用UNet做去噪网络(这一章后面再展开UNet),用线性的噪声调度(β_t从0.0001线性增长到0.02),用1000步的扩散步数。这些参数设置看似平淡,但都是Ho等人反复试错调出来的"工程sweet spot"。后续两三年所有人都基本沿用这套配置。 结果就是DDPM一发出来,第一次让扩散模型生成出了能跟GAN掰手腕的图。CIFAR-10的FID降到3.17,比当时最好的GAN(StyleGAN2)还低一点。无条件CIFAR-10生成质量从2015年的"玩具级"一跃到"业界SOTA"。 ## 3.2 临门一脚:Beat GANs 如果说DDPM是扩散模型的成人礼,那2021年OpenAI那篇论文就是它正式上桌的入场券。 2021年5月11日,OpenAI研究员Prafulla Dhariwal和Alex Nichol在arXiv上传了一篇论文,题目极其直白:《Diffusion Models Beat GANs on Image Synthesis》(《扩散模型在图像生成上打败了GAN》)。NeurIPS 2021接收为Spotlight。 这篇论文做了三件事。一是把UNet架构进一步调优(加更多注意力层、改残差结构),让去噪网络容量更大。二是提出了"classifier guidance"(分类器引导),用一个预训练的分类器在采样时给扩散过程加权,让生成的图更偏向特定类别。三是在ImageNet上做了大量实验。  结果:ImageNet 128x128 FID 2.97、256x256 FID 4.59、512x512 FID 7.72,全面打败当时最强的GAN(BigGAN-deep)。甚至在采样步数压到25步时还能匹敌BigGAN。论文标题就是论点,没有任何修饰。 这篇论文之后,整个生成模型圈子的风向开始转。原本研究GAN的实验室开始转去做扩散模型。论文发表的会议(NeurIPS、ICML、CVPR)里扩散模型相关论文数量从2021到2023年增长了几十倍。一个2015年提出、沉默五年的冷门方向,五年内从边缘走到了所有人都要做的主流。 ## 3.3 它治好了 GAN 的三个老毛病 DDPM加上Beat GANs这条路线让扩散模型站稳脚跟,根本原因是它对GAN的三个老毛病有结构性的优势。这些优势在第三章已经埋了伏笔,这里把它们摆在桌面上。  第一点和第二点对训练工程师最重要。GAN的训练不稳定是公认的痛点,做GAN项目的人都会经历"训了几个月没结果"的时刻。扩散模型把训练问题转化成回归之后,工程上像换了一个赛道,损失曲线平滑下降,没人盯着它会突然崩。 第三点对产品最重要。Stable Diffusion后来能做出各种各样的下游功能(文生图、图生图、inpainting局部重绘、outpainting外扩、ControlNet骨架/边缘图控制、LoRA微调),全建立在"每步都能注入控制信号"这个特性上。GAN也能勉强做这些,但每种功能要单独训一个网络,扩散模型一个底座全包。 到这里扩散模型的根基算是站稳了。但要从一个学术研究里的算法变成普通人能用的产品,还差几个零件。下一章讲组装。 # 四、组装成产品:一个文生图系统由哪几块组成 学术论文里的扩散模型,输入是一张噪声图,输出是一张猫。但产品里的扩散模型,输入是一句中文prompt"一只戴帽子的橘猫坐在窗台",输出是一张猫。中间多了几个零件。 这一章拆开看看Stable Diffusion这种文生图系统的四个零件,各自管什么、参数装着什么。讲完这一章你下次跑Stable Diffusion就知道每一步在调什么。  先说一句:下面这套"四零件"拆解是Stable Diffusion家族最标准的形态。它是唯一开源、架构完全公开的主流文生图系统,业内多数闭源模型也是它的衍生或借鉴。但其它扩散模型在每个零件上的具体选择有差异。Google的Imagen走的是"像素空间扩散+多级超分",没有VAE这一块。OpenAI的DALL-E 2用了"prior + decoder"两段式架构。FLUX走rectified flow而非DDPM。这一章末尾会有一张对比表。理解SD的四零件就理解了扩散模型工程化的主线,其它系统是这条主线上的变体。 ## 4.1 去噪网络:参数最多的心脏 去噪网络是整个系统的心脏,也是参数最多最核心的部分。第三章讲的就是它。它的任务很单纯:输入当前带噪图、当前时间步t、文本条件(这一步后面会讲),输出预测的噪声。 去噪网络装着系统里最重要的一类参数:视觉规律。它在训练时看过几亿张图,把"什么样的像素组合更像真图"压进了几亿到几十亿个参数。Stable Diffusion 1.5的UNet去噪网络是8.6亿参数(约4GB),SDXL是26亿参数(约13GB),Stable Diffusion 3最大版本是80亿参数。 这是一个朴素的规律:去噪网络越大,能压进的视觉规律越多,生成质量越高。从SD 1.5到SDXL到SD3,每一代去噪网络都在变大,模型文件从几个GB涨到几十GB。同时显存需求和推理时间也跟着涨。Colab免费T4 15GB显存跑SD 1.5很舒服,到SDXL就开始抠门,SD3得切付费档才跑得动。 去噪网络的内部架构是这一章后面要单独讲的话题。早期是UNet(卷积神经网络),后期转向Transformer。这是第六章的内容,先按下。 ## 4.2 文本编码器:把"橘猫戴帽子"翻译成向量 要让模型听懂"一只戴帽子的橘猫"这句话,要先把这句话翻译成网络能消化的向量。这件事由文本编码器(text encoder)干。 文本编码器本身是一个独立的神经网络,跟去噪网络分开。它接收一个字符串,输出一段固定维度的向量序列。这段向量序列是这句话的"语义指纹",扩散模型在去噪每一步都会参考这段向量决定怎么擦。 举个例子。Stable Diffusion 1.x用的文本编码器是OpenAI的CLIP,2021年发布的图文对比模型。CLIP本身用4亿对图文数据训练,学会把图和文字映射到同一个向量空间里。文生图模型借用CLIP的文本编码器部分,把prompt编码成向量。  SDXL用了两个CLIP(OpenAI CLIP-L和OpenCLIP-G)并行做编码,把两份向量拼在一起。这是为了让模型对prompt的理解更细。SD3进一步加入了Google的T5(一个纯文本Transformer),跟两个CLIP并存。T5对长prompt和复杂句法的理解更强,这是SD3能生成图里的可读文字的关键之一。 文本编码器装的是另一套参数:语言规律。它本身就是一个Transformer,有自己独立的几亿参数。这套参数压的是"哪些词跟哪些视觉概念关联"这种映射。 实务上一个有意思的现象:换文本编码器对生成结果的影响极大。同一个去噪网络配不同的文本编码器,对prompt的响应可以完全不一样。SD3之所以prompt理解比SDXL好得多,主要功劳在T5。 文本编码器和去噪网络通过一个叫"cross-attention"(交叉注意力)的机制连接。去噪网络在每一步都看一眼文本向量,根据当前正在生成的图像内容决定接下来去噪要往哪个方向调。这是"每步可控"性质的具体实现。 ## 4.3 VAE:把图压进"小空间"里 直接在512x512或1024x1024的像素空间做扩散,对算力是个负担。每一步去噪网络要处理几十万个像素值的张量,几百步算下来计算量爆炸。 2022年Robin Rombach等人在CVPR论文《High-Resolution Image Synthesis with Latent Diffusion Models》里提出了一个工程改进:把扩散过程放进"潜空间"(latent space)里跑。这就是Latent Diffusion,也是Stable Diffusion的"L"。 具体怎么做?先训一个VAE(变分自编码器),它的编码器能把一张512x512x3的图压成64x64x4的潜向量(信息量降了64倍),它的解码器能把潜向量还原回512x512x3的图。压缩比很高,但因为VAE是为这个任务专门训的,还原出来的图基本看不出损失。 然后扩散过程全在潜空间里跑。前向加噪是给64x64x4的潜向量加噪,反向去噪是网络从噪声潜向量里擦出干净的潜向量。最后用VAE解码器把潜向量还原成像素图。 这个改进的效果直接:扩散网络要处理的张量小了64倍,训练和推理速度提升一两个数量级。原来要A100跑半天的训练,现在普通4090能在合理时间跑完。Stable Diffusion能在2022年开源时跑在消费级GPU上,VAE这一步是关键工程突破。 VAE本身的参数不多(几千万到一亿),不是系统里最重要的参数。它的角色更像"图像压缩器",把扩散过程从"贵的像素空间"挪到"便宜的潜空间"。 我刚开始玩SD的时候不理解VAE的作用,遇到生成图颜色发灰、对比度不对的问题,后来才知道是VAE版本不匹配。换一个更好的VAE(比如MSE版本),同一个prompt出图质量就好一档。VAE虽然不显眼,但是产品里隐藏的小杠杆。  ## 4.4 采样器:决定怎么走这几百步 扩散模型理论上要走1000步去噪。但每一步都过一遍8.6亿参数的网络太慢,一张图要几分钟。 采样器(sampler,又叫调度器scheduler)这一块零件的活就是想办法少走几步还能保证质量。 最简单的采样器叫DDPM(跟那篇论文同名),就是按论文里的公式一步步走,需要1000步。一张图要1000次网络推理,慢得难用。 DDIM(Denoising Diffusion Implicit Models,2020年Song等人提出)改了一下采样过程的公式,把它从随机过程变成确定性过程,可以跳着走。原来必须一步步走完1000步,现在可以每10步采一个,整体只走50步,质量没明显损失。这是采样器的第一次大跃进。 后续几年涌现出一堆采样器:DPM-Solver、Euler、Heun、UniPC、LCM。每一个都在"步数vs质量"的trade-off上做不同选择。到2024年,LCM(Latent Consistency Model)和Turbo系列把步数压到1-4步,几乎实时出图,但质量稍打折扣。 采样器跟前面三块的本质区别是:它基本没有参数,是写死的数学规则。换采样器不需要重新训练模型,调一下推理时用的算法就行。Stable Diffusion WebUI里那个"Sampling method"下拉菜单换不同选项,就是在换采样器。 我当年常用的是DPM++ 2M Karras,20-30步,质量和速度平衡得最好。生产环境追求速度可以用LCM 4步。这是产品工程师每天在调的细节。  ## 4.5 四个零件的合奏:一次生成的完整流程 把上面四块拼起来,一次"输入prompt生成一张猫"的完整流程是这样的: 1. 用户输入prompt "a tabby cat wearing a hat sitting on a windowsill" 2. 文本编码器(CLIP/T5)把这句话编码成一个向量序列 3. 采样器初始化一张64x64x4的纯高斯噪声(潜空间里的雪花) 4. 采样器按预定的步数(比如20步),每一步把当前潜向量、当前时间步、文本向量喂给去噪网络 5. 去噪网络输出噪声预测,采样器按公式把潜向量稍微擦干净一点 6. 重复20步后,潜空间里得到一个干净的潜向量 7. VAE解码器把潜向量还原成512x512的像素图 8. 输出给用户 整个流程从输入prompt到出图大约3-10秒,看GPU和步数。 回到这一章开头说的"参数装着什么"的问题。Stable Diffusion 1.5一个checkpoint文件4GB左右,里面装的是这三块的参数: - UNet去噪网络:约3.4GB(约8.6亿参数) - CLIP文本编码器:约500MB(约1.2亿参数) - VAE:约300MB(约0.8亿参数) 读者最关心的"压缩了万物的那套参数",特指去噪网络这一块。它装着系统里所有的视觉规律。文本编码器装的是语言-视觉映射规律。VAE装的是图像压缩规律。三块各管一摊,长在不同零件里。 学习等于压缩这个视角,跟LLM那篇里"GPT压缩了文本规律"是同一个道理。一个几GB的模型文件能画万物,前提是它把视觉世界的统计规律压进了参数里。这种压缩能力是过去十年深度学习最大的工程奇迹之一。  ## 4.6 主流扩散模型在这四个零件上的差异 回到这一章开头的免责。SD的四零件是工程化扩散模型的主线模板,但其它主流模型在每一块上的具体选择有差异。一张表对照:  读这张表的一种方式:四个零件是"工程位置",每个位置可以塞不同的具体技术。SD的版本是其中一种成熟选择,FLUX和Imagen说明每个位置都有别的走法。整套扩散范式(加噪/去噪/采样)不变,变的是每个零件内部的实现。 # 五、换引擎:从 U-Net 到 Transformer 这一章讲扩散模型最近三年最大的一次内部改造:去噪网络的架构从UNet换成了Transformer。这也是和LLM那篇文章咬合最紧的一章,因为换上去的Transformer就是LLM那条线上的同一个东西。 要破除最大的一个误解先讲清楚。 ## 5.1 破除最大的误解:不是"Transformer 取代了扩散模型" 我经常看到一种说法:"DiT类视频模型把扩散模型换成了Transformer。"这句话错得很彻底。 扩散是"范式",也可以叫"流程"或"菜谱",指的是"加噪-学习去噪-反向生成"这一整套流程。Transformer是"架构",指的是一个神经网络内部怎么搭。两者不在同一个层级。 打个比方。扩散是一道菜的做法(先做酱、再炒、最后勾芡),Transformer是炒锅。换炒锅不等于换做法。Veo 3、可灵这类DiT模型是先用扩散的流程把视频加噪降噪,然后用Transformer作为去噪网络的内部实现,整套加噪去噪流程一步没动。它是Diffusion + Transformer,所以才有DiT(Diffusion Transformer)这个并列的名字。这个架构是2022年底William Peebles和谢赛宁在UC Berkeley提出的,2024年被Sora、SD3用进产品。 补一个常见疑问:DiT里的Transformer是encoder还是decoder?答案是encoder-style,跟BERT、ViT是一脉,跟GPT那种decoder不一样。原因是每一步去噪要并行处理整张图(或整段视频)的所有patch,每个patch都要看到其它所有patch才能做局部去噪决策,需要双向注意力。GPT那种"只能看自己和前面"的causal mask在这里完全用不上。这也解释了DiT的输出形态:每个patch输出一个噪声预测,所有patch并行出,不像GPT那样一次只出一个token。 这个误解从哪来?因为很多技术媒体把"换上Transformer"和"扩散模型升级"打成一个词,读者不细看就理解成"用Transformer替换扩散模型"。实际上每个产品里都是两个东西并存:扩散范式管整体流程,Transformer管去噪网络的内部架构。 讲清楚了这一点,下面这一节讲清楚原来用的那个东西(UNet)是什么。 ## 5.2 U-Net 是什么,为什么当初选它 UNet是2015年慕尼黑大学Olaf Ronneberger等人为医学图像分割提出的卷积神经网络架构。它的名字来自它的形状像U:左边是下采样路径(编码器,把图越压越小),右边是上采样路径(解码器,把图越扩越大),中间有跨层连接(skip connection),把下采样路径同一层级的特征图直接接到上采样路径对应层级。 UNet天生贴合图像处理任务,因为它有两个特性。一是局部归纳偏置:卷积核在图像上滑动扫描,每个卷积核只看局部一小块,这种结构假设"图像的局部相关性比远距离相关性强",对自然图像非常对路。二是多尺度结构:U形从大尺度(小特征图)到小尺度(大特征图)都覆盖了,能同时处理高频细节和低频结构。  DDPM 2020年选UNet作为去噪网络的内部架构,理由很直接:UNet那两年在分割、超分辨率等密集预测任务上已经被验证好用,扩散模型本质上也是"输入一张图、输出一张图"的密集预测任务,UNet正好。后续两三年所有扩散模型都用UNet:Stable Diffusion 1.x、SDXL、DALL·E 2、Imagen,全是UNet。 UNet的参数就是一堆卷积核里的数字。Stable Diffusion 1.5的UNet大约8.6亿参数,SDXL扩到26亿。卷积核的数量和大小决定了网络的容量。 但UNet有一个问题:它的设计假设"局部相关性强"对图像非常合适,但对越大越复杂的场景越力不从心。一张2K分辨率的图里,左上角的灯光和右下角的影子可能有关系,但UNet的卷积核要堆很多层才能让左上和右下"对话"。这种远距离依赖在UNet里很弱。 而且UNet越做越大时,质量不一定跟着涨。SD 1.5(8.6亿)到SDXL(26亿)质量明显提升,但继续往上堆,回报曲线开始平。这是引擎换型的根本动力。 ## 5.3 为什么后来换成 Transformer 换成Transformer有四个原因。 第一个原因,最关键的,是scaling。Transformer在大语言模型上已经被验证有非常稳定的scaling law:参数加大,数据加大,算力加大,loss可预测地下降,质量可预测地提高。从GPT-2到GPT-3到GPT-4,参数从15亿涨到几千亿,质量几乎是阶梯式跃升。 UNet没有这种性质。卷积网络做大之后,收益曲线很快变平。研究者一直怀疑这是卷积本身的归纳偏置太强,把模型的容量"卡死"在某个上限。如果换成Transformer这种归纳偏置很弱的架构,能不能解锁同样的scaling能力?2022年Bill Peebles和Saining Xie在《Scalable Diffusion Models with Transformers》(这就是DiT那篇论文)里给出了正面答案:可以。他们的实验显示,DiT在ImageNet上的生成质量随模型规模稳定提升,scaling曲线非常干净。 第二个原因是全局视野。Transformer的核心机制是attention(注意力),它让序列里任意两个token直接对话,没有距离限制。在图像上对应"图里任意两块直接交换信息"。SD 1.5要画一张图里"左上角的太阳和右下角的影子方向一致",UNet要十几层卷积才能勉强协调,DiT用attention一步就能看见全图。 这个对应到LLM那篇里讲过的"attention解决了RNN的长距离衰减"。文字这条线上,attention帮Transformer取代了RNN。图像这条线上,attention帮DiT取代了UNet。两条线上同一个机制解决同一类问题。 第三个原因是天生适合融合文字。文生图模型本质是"图+文字"的多模态任务。Transformer处理token序列,图可以切成图块(patch)当token,文字本身就是token,两个模态的token塞进同一个序列里跑attention,文字和图像就在统一空间里融合了。UNet要专门加cross-attention模块才能融合文字,结构上不如DiT原生。 第四个原因是白嫖LLM行业的工程红利。整个LLM行业过去几年在Transformer上堆了海量工程优化:flash attention、PagedAttention、量化、混合精度训练、推理加速框架(vLLM、TGI)。扩散模型换成Transformer之后这套优化全可以拿来用,工程成本几乎为零。这是后期SD3、FLUX、Veo 3这类产品快速scale的重要原因。 但要诚实说一句:Transformer不是全面碾压UNet。在小规模、低算力场景下,UNet的归纳偏置反而是优势。UNet对图像的局部相关性假设让它在数据少、算力少时仍然能学到不错的图像规律,Transformer在小规模下经常表现得不如UNet。这是为什么很多本地工具、消费级GPU上的开源模型至今还在用UNet。换Transformer的红利要到一定规模之上才显现。 ## 5.4 切换的时间线(亲历者视角) 我入坑Stable Diffusion是2022年下半年,那时候SD 1.4刚开源。自己机子没显卡,全靠Colab挂个T4在跑。下载的checkpoint里装的都是UNet权重,我那时候根本没想过几年后这个架构会被换掉。 UNet到Transformer的切换时间线大致是这样的:  注意论文(2022年底)到产品(2024年)之间隔了一年多。这是工业界很常见的节奏。可行不等于能落地。要从论文到产品要重新训练超大模型、调通工程链、配合文本编码器和VAE一起改、压成本能跑在用户GPU上。一年多算快的。 补一个有意思的细节。DiT那篇论文的第一作者Bill Peebles 2022年还是UC Berkeley的博士生,2023年加入OpenAI,参与了2024年发布的视频生成项目。他自己读博时提出的架构两年后被自己用在一个改变行业的产品上。这种"论文-产品"闭环在AI研究者里不算罕见,但能这么快地走完整条路径的不多。 我现在再回头看自己当年下载的SD 1.5权重,会想起一句话:"我入坑时下载的还都是UNet权重,几年后再回头,主流已经悄悄换成Transformer了。"换引擎这件事在用户层面几乎没有感知,因为产品名字(Stable Diffusion 3、FLUX、Veo 3)没有透露架构。只有翻技术文档才知道里面已经是另外一种网络。 # 六、从图片到视频(2024 至今) 讲第二个误解。视频生成看起来像一个全新的技术,实际上是"扩散范式 + Transformer骨干"这套组合长大后的自然延伸,没有任何新范式。 ## 6.1 视频是图片多了一个时间维度 视频在数学上就是图片多了一个维度。一张图是空间上的二维张量(高x宽x颜色通道),一段视频是时空上的三维张量(时间x高x宽x颜色通道)。 生成视频比生成图片难,难在哪?两个维度。第一个维度是每一帧本身要像真照片,这是图像生成本来就要解决的问题。第二个维度是帧与帧之间要连贯,物体不能跳跃,光影不能突变,物理动作要符合常识。第二个维度才是视频生成真正的挑战。 举个具体例子。让模型生成"一只猫从沙发上跳下来"的几秒视频。如果只保证每一帧画一只猫,每一帧画一个沙发,那十帧拼起来可能是十只长得不一样的猫和十张不同的沙发,看起来像幻灯片。视频生成要求第一帧的猫和第二十帧的猫是同一只猫,毛色不变、姿势连贯,下落过程符合重力。 这种"跨帧一致性"是过去几年视频生成最难的问题。早期视频生成模型(2022-2023年的MakeAVideo、Imagen Video)都试图解决,但效果差强人意,画面经常糊或者跳。直到2024年初产品级AI视频才第一次面世,跨帧一致性才开始有像样的解决方案。  The illustration of Make-A-Video pipeline.(Image source: Singer et al. 2022) ## 6.2 为什么偏偏 Transformer 让视频成了 今天视频生成的主流技术选择都是DiT,也就是用Transformer做扩散模型的去噪网络。这个选择直接决定了视频生成能不能做出来。 Transformer的核心机制attention处理"任意两个位置直接对话",天生在行。在图像上意味着任意两块直接交换信息,在视频上意味着任意时间任意空间的两块直接交换信息。把"图块"扩展成"时空块"(spatiotemporal patches),同一套Transformer几乎原封不动就能处理视频。 UNet对时间维度很别扭。卷积是空间上滑动扫描,要处理时间维度要么用3D卷积(计算量大得离谱),要么用循环结构(远距离衰减问题严重)。这两条路在2022-2023年都试过,效果都不好。 DiT视频模型做的事是把视频先切成时空patch(每个patch是空间上的小方块加时间上的几帧),把这些patch当token,喂给Transformer做去噪。这套架构在空间和时间上对称,attention同时处理空间一致性和时间一致性。 我第一次看到产品级AI视频是2024年初那一波预览片段(东京街头女人走路那种),反应是"这跟我用SD跑出来的猫不是一个量级的东西"。但拆开看里面没有任何全新的范式:仍然是从噪声开始去噪,仍然是用神经网络擦干净,仍然是用VAE做压缩(视频版的)。变的只是Transformer取代了UNet,patch扩展到了时空。同一套老配方,换了一个新引擎。 ## 6.3 扩散范式从头没变 到这里全文的核心认知要再说一遍:从2015年Sohl-Dickstein提出扩散,到2020年DDPM,到2022年Stable Diffusion,到2024年视频生成大规模登场,加噪-去噪这套流程一步没动。 变的是去噪那一步内部用什么网络(UNet → Transformer)。变的是去噪对象(一张图 → 一张潜空间小图 → 一段时空数据)。变的是注入控制信号的方式(无条件 → 类别条件 → 文本条件 → 多模态条件)。 不变的是流程本身:撒噪声、训练神经网络擦噪声、从随机噪声反向生成。十年了,这套流程稳得像物理定律。 这是一个有意思的现象。AI领域里很多技术五年就换一茬,但扩散范式跑了十年还是同一套核心流程。原因可能是它的数学结构太干净,每一步都对应到非平衡热力学里一个具体的过程,工程改进只是在调参数和换组件,不需要推翻框架。 2024-2026年这一波视频生成产品全是DiT变体。Sora 1在2024年点燃赛道,但OpenAI 2026年3月宣布关停Sora消费端,4月app下线,9月API也关停。原因是算力成本太高(The Information估算每天1500万美元)和用户30天留存不到8%,赚不回钱。 Sora退场之后,当下还活着的视频生成主力是Google的Veo 3、快手的可灵、Runway Gen-4,全是DiT变体。视频生成接下来几年的迭代基本会沿这套配方继续走:更大的Transformer、更高的分辨率、更长的视频、更好的物理一致性。范式本身不会动。 # 结语:一条十年的主线 把全篇压成一条主线,2015 到 2026 这十年扩散模型走完了六步。 来源。2015 年一个生物物理博士把热力学的扩散搬进了生成模型,发了奠基论文。范式有了,工程没跟上。 沉默。思想很早,但又糊又慢,被冷藏五年。同期 GAN 一年几百篇 paper,扩散这一脉只有几个团队还在做。 翻身。2020 年 DDPM 把训练目标简化成预测噪声,质量第一次能跟 GAN 平起平坐。2021 年 OpenAI 用一句直白的论文标题《Diffusion Models Beat GANs on Image Synthesis》宣告了赛道易主。 组装。去噪网络 + 文本编码器 + VAE + 采样器四个零件凑齐,扩散从论文里的算法变成了 Stable Diffusion 这种能跑在消费级 GPU 上的产品。用户敲一句 prompt,3 秒后看到图。 换引擎。去噪骨干从 UNet 换成 Transformer,DiT 这个组合让扩散模型能享受 LLM 行业积累的 scaling 曲线和全部工程红利。Stable Diffusion 3、FLUX 都走这条路。 长大。同一套加噪去噪范式装上 Transformer 引擎,把图块扩展到时空块,从画图迈进了视频。Veo 3、可灵、Runway Gen-4 这些 2026 年还活着的视频生成产品都是这套配方。 回到全文最深的一个观察。扩散这条线和 LLM 那条线在 Transformer 这块积木上汇合了。文字那条线的核心是"自回归 + Transformer",预测下一个 token。图像视频这条线的核心是"扩散 + Transformer",预测下一步要擦的噪声。两条线出身完全不同,文字这条来自统计语言学和神经网络的合流,图像视频这条来自统计物理和神经网络的合流。但它们都被 Transformer 这块积木统一进了内部,正在汇合成今天的多模态 AI。 最后留一个小彩蛋。扩散模型的发明人 Jascha Sohl-Dickstein,2024 年从 Google 跳槽到了 Anthropic。下次你打开 Claude 看它的回答时,记得这家公司里坐着把热力学搬进 AI 的那个人。 ## 作者其它文章 - 美国税收制度完全指南 - 当物理遇上AI:深度学习里的物理元素(上) - 一文看懂美国的法律系统 - 教宗良十四世论人工智能(精华版) - 廉颇老矣,尚能饭否:现代数学史(下) - 一篇文章讲清楚美国的移民系统 - 大航海时代2的逆向工程实验 - 量子计算机有前途吗? - 祖父积分学概论 - 我见青山多妩媚:二十世纪数学史(上) - 一文讲清楚美国医疗系统 - AI 如何打进美国教育生态? - 一篇文章看懂美国教育全生态 - 马斯克把 xAI 并入 SpaceX,到底意味着什么? - Vibe Learning:AI 时代,学习这件事被重新组织了 - 福特经济学和 AI 经济学 - 数学照妖镜:AI 能发现新的数学定理吗? - 一篇文章讲清大语言模型发展史 - Vibe Reading:AI 时代读书的系统化方法 - 长篇分析:Manus 案折射出的中国 AI 创业生态 - 两万字科普:AI 为什么会编程,原理、历史与未来 - 全网最详细的AI学习路线图 - AI 将如何颠覆教育,普通人又应该如何抢夺教育新的生态位 - 学物理的八方英雄们,物理学已死,请转行搞AI - 兄弟们想清楚:究竟是你为X打工,还是X为你打工? - 重返星辰大海:这次绕月飞行有意义吗? ## 本文参考文献 - Deep Unsupervised Learning using Nonequilibrium Thermodynamics - Sohl-Dickstein, Weiss, Maheswaranathan, Ganguli, ICML 2015 (PMLR Vol. 37, pp. 2256-2265)。扩散模型奠基论文。arXiv 1503.03585 - Denoising Diffusion Probabilistic Models (arXiv:2006.11239) - Ho, Jain, Abbeel, 2020 NeurIPS,DDPM 论文 - Diffusion Models Beat GANs on Image Synthesis (arXiv:2105.05233) - Dhariwal & Nichol, OpenAI, 2021 NeurIPS Spotlight - High-Resolution Image Synthesis with Latent Diffusion Models (arXiv:2112.10752) - Rombach et al., 2022 CVPR,Latent Diffusion / Stable Diffusion 论文 - Scalable Diffusion Models with Transformers (arXiv:2212.09748) - Peebles & Xie, 2022,DiT 论文 - Generative Adversarial Networks (arXiv:1406.2661) - Goodfellow et al., 2014,GAN 奠基论文 - Generative Modeling by Estimating Gradients of the Data Distribution (arXiv:1907.05600) - Song & Ermon, 2019,score-based 视角 - Jascha Sohl-Dickstein 个人网站 - 含教育背景(UC Berkeley 生物物理博士、NASA 火星探测项目前员工)和现状(Anthropic Member of Technical Staff) - Sora is here - OpenAI - OpenAI 2024年12月9日 Sora 公开发布说明 - Sora (text-to-video model) - Wikipedia - 含 2024年2月15日预览、12月9日公开发布、DiT 架构细节 - What to know about the Sora discontinuation - OpenAI Help Center - OpenAI 官方关停时间表(app 2026.4.26 下线、API 2026.9.24 关停) - Announcing SDXL 1.0 - Stability AI - 2023年7月 SDXL 发布 - Stable Diffusion 3: Research Paper - Stability AI - 2024年6月 SD3 / MMDiT 发布 - Stable Diffusion - Wikipedia - 含 2022年8月22日 SD 1.x 发布、CompVis/LMU Munich/Runway/Stability AI 联合发布 - 一篇文章讲清大语言模型发展史 - 本系列上篇,文字这条线的发展历程 ## 相关链接 - [snowboat](https://x.com/snowboat84) - [@snowboat84](https://x.com/snowboat84) - [373](https://x.com/snowboat84/status/2061598950944305295/analytics) - [一篇文章讲清大语言模型发展史](https://x.com/snowboat84/status/2051444935547912236) - [美国税收制度完全指南](https://x.com/snowboat84/status/2060511915617779821) - [当物理遇上AI:深度学习里的物理元素(上)](https://x.com/snowboat84/status/2060145538922844179) - [一文看懂美国的法律系统](https://x.com/snowboat84/status/2059795010330251568) - [教宗良十四世论人工智能(精华版)](https://x.com/snowboat84/status/2059434342745866391) - [廉颇老矣,尚能饭否:现代数学史(下)](https://x.com/snowboat84/status/2059071134738620606) - [一篇文章讲清楚美国的移民系统](https://x.com/snowboat84/status/2057980486501433383) - [大航海时代2的逆向工程实验](https://x.com/snowboat84/status/2057264254319993332) - [量子计算机有前途吗?](https://x.com/snowboat84/status/2056895775578456417) - [祖父积分学概论](https://x.com/snowboat84/status/2056533111983493136) - [我见青山多妩媚:二十世纪数学史(上)](https://x.com/snowboat84/status/2055446902171406761) - [一文讲清楚美国医疗系统](https://x.com/snowboat84/status/2055081426744422697) - [AI 如何打进美国教育生态?](https://x.com/snowboat84/status/2054721509420372180) - [一篇文章看懂美国教育全生态](https://x.com/snowboat84/status/2054359249917210633) - [马斯克把 xAI 并入 SpaceX,到底意味着什么?](https://x.com/snowboat84/status/2054000682114613488) - [Vibe Learning:AI 时代,学习这件事被重新组织了](https://x.com/snowboat84/status/2052908751435477046) - [福特经济学和 AI 经济学](https://x.com/snowboat84/status/2052551731385602072) - [数学照妖镜:AI 能发现新的数学定理吗?](https://x.com/snowboat84/status/2052174034041995572) - [一篇文章讲清大语言模型发展史](https://x.com/snowboat84/status/2051444935547912236) - [Vibe Reading:AI 时代读书的系统化方法](https://x.com/snowboat84/status/2050008577511973253) - [长篇分析:Manus 案折射出的中国 AI 创业生态](https://x.com/snowboat84/status/2049643679804248305) - [两万字科普:AI 为什么会编程,原理、历史与未来](https://x.com/snowboat84/status/2048919554882215954) - [全网最详细的AI学习路线图](https://x.com/snowboat84/status/2047457686070141051) - [AI 将如何颠覆教育,普通人又应该如何抢夺教育新的生态位](https://x.com/snowboat84/status/2044932338262667509) - [学物理的八方英雄们,物理学已死,请转行搞AI](https://x.com/snowboat84/status/2044584627046920278) - [兄弟们想清楚:究竟是你为X打工,还是X为你打工?](https://x.com/snowboat84/status/2043842017260908743) - [重返星辰大海:这次绕月飞行有意义吗?](https://x.com/snowboat84/status/2042405716380835998) - [Deep Unsupervised Learning using Nonequilibrium Thermodynamics](https://proceedings.mlr.press/v37/sohl-dickstein15.html) - [arXiv 1503.03585](https://arxiv.org/abs/1503.03585) - [Denoising Diffusion Probabilistic Models (arXiv:2006.11239)](https://arxiv.org/abs/2006.11239) - [Diffusion Models Beat GANs on Image Synthesis (arXiv:2105.05233)](https://arxiv.org/abs/2105.05233) - [High-Resolution Image Synthesis with Latent Diffusion Models (arXiv:2112.10752)](https://arxiv.org/abs/2112.10752) - [Scalable Diffusion Models with Transformers (arXiv:2212.09748)](https://arxiv.org/abs/2212.09748) - [Generative Adversarial Networks (arXiv:1406.2661)](https://arxiv.org/abs/1406.2661) - [Generative Modeling by Estimating Gradients of the Data Distribution (arXiv:1907.05600)](https://arxiv.org/abs/1907.05600) - [Jascha Sohl-Dickstein 个人网站](http://sohldickstein.com/) - [Sora is here - OpenAI](https://openai.com/index/sora-is-here/) - [Sora (text-to-video model) - Wikipedia](https://en.wikipedia.org/wiki/Sora_(text-to-video_model)) - [What to know about the Sora discontinuation - OpenAI Help Center](https://help.openai.com/en/articles/20001152-what-to-know-about-the-sora-discontinuation) - [Announcing SDXL 1.0 - Stability AI](https://stability.ai/news/stable-diffusion-sdxl-1-announcement) - [Stable Diffusion 3: Research Paper - Stability AI](https://stability.ai/news/stable-diffusion-3-research-paper) - [Stable Diffusion - Wikipedia](https://en.wikipedia.org/wiki/Stable_Diffusion) - [一篇文章讲清大语言模型发展史](https://x.com/snowboat84/status/2051444935547912236) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [8:01 AM · Jun 2, 2026](https://x.com/snowboat84/status/2061598950944305295) - [373 Views](https://x.com/snowboat84/status/2061598950944305295/analytics) --- *导出时间: 2026/6/2 09:19:05*
M Math Behind Large Language Model 本文介绍了大语言模型背后的数学原理,涵盖Attention机制、缩放因子、反向传播、梯度下降、交叉熵损失、RoPE位置编码和RMSNorm归一化等核心概念。 技术 › LLM ✍ Amit Shekhar🕐 2026-07-30 LLM数学原理AttentionTransformer机器学习深度学习梯度下降反向传播RoPERMSNorm
A AI 儿童绘本副业:一套用 ChatGPT、Canva 做出首单的实操流程 文章详细介绍了利用 ChatGPT 和 Canva 等工具制作 AI 儿童绘本并变现的完整流程。涵盖工具准备、分镜撰写、角色设定、插图生成、排版质检及获客报价策略,旨在指导新手完成从 0 到 1 的首单交付。 技术 › LLM ✍ Christal.Z🕐 2026-07-16 AI副业儿童绘本ChatGPTCanva实操流程变现图像生成AIGC
开 开源一个文章配图 Skill:歸藏材质插画 作者开源了一款名为“歸藏材质插画”的 Skill,旨在解决文章、汇报及教学中概念解释难的问题。该工具通过调用 GPT-Image 2.0,能将文本转化为风格统一、带中文标签的 3D 材质解释图。文章详细介绍了其在处理冷门概念检索、图表数据重绘以及防止 AI 乱写标签等方面的技术优化。 技术 › Skill ✍ 歸藏🕐 2026-07-08 AIGCClaudeAgent图像生成开源工具提示词工程数据可视化设计
P PyTorch 训练流程速查表 这是一份关于 PyTorch 训练流程的单页速查表。文章通过代码示例和原理解析,深入浅出地讲解了张量的核心概念、矩阵乘法、自动求导机制、反向传播以及梯度下降优化过程。同时涵盖了 `nn.Module` 常用组件如 Linear、ReLU 和 GELU 的使用,旨在帮助开发者快速理解深度学习引擎的运作原理。 技术 › 编程语言 ✍ kozue🕐 2026-07-03 PyTorch深度学习教程张量Autograd机器学习速查表矩阵乘法反向传播Python
当 当物理遇上AI:深度学习里的物理元素(上) 文章探讨了物理学与人工智能(特别是深度学习)之间的深刻联系。作者指出,神经网络本质上是一个类似于物理学中的“多体系统”,因此统计力学的语言天然适用于描述AI。文章详细拆解了能量最小化、Softmax(玻尔兹曼分布)、交叉熵(信息熵)、VAE(自由能)以及最大熵原理等核心AI概念背后的物理学渊源,揭示了从蒸汽机到神经网络的知识传承。 技术 › 人工智能 ✍ snowboat🕐 2026-06-05 深度学习物理学统计力学神经网络熵Softmax交叉熵自由能机器学习方法论
2 2026年你必须理解的20个AI核心概念 文章通俗易懂地解释了现代AI的基础原理,涵盖神经网络、Token化、Embeddings、注意力机制及Transformers架构。深入探讨了LLM的工作原理,如上下文窗口、温度控制和幻觉问题,并讲解了提示词工程技巧。 技术 › LLM ✍ Rahul🕐 2026-05-23 AILLMTransformers原理科普机器学习Prompt Engineering神经网络基础概念人工智能2026
完 完美逆向文生图提示词的方法找到了 文章介绍了一种利用 Codex 创建两个子智能体(逆向提示词智能体 A 和监督智能体 B)的方法,通过 A 生成提示词、B 生图并对比找差异的循环迭代机制,将任意图片精准逆向为可复用的文生图提示词。实验表明,通过 3 轮迭代,成功将风格描述升级为版式锁定和视觉重心的精确约束,实现了 95 分的高保真复刻。 技术 › LLM ✍ Bridge Wang🕐 2026-05-21 文生图提示词工程AI工作流多智能体图像生成Codex逆向工程版式设计AIGC
从 从零到 AI 工程师——没人真正讲清楚的路线图 本文为 AI 初学者提供了一份为期 14 周的实战路线图,旨在通过免费资源将新手培养成具备构建生产级 AI 系统能力的工程师。路线图包含六个阶段:环境搭建、AI 基础、机器学习基础、深度学习、现代 LLM 工程以及 Agent 与部署。文章强调动手实践,推荐了 OpenAI、Anthropic 官方教程及 GitHub 优质开源仓库,帮助学习者避开盲目刷证书的误区,真正掌握 AI 开发技能。 技术 › LLM ✍ 土豆本豆🕐 2026-05-18 AI工程师学习路线图LLMAgent深度学习RAGPython实战教程机器学习AI基础
做 做了上千个 AI 图像视频之后,我发现 90% 的新手都在犯同一个错误(附完整学习路径总结) 作者基于自身创作上千个作品的实战经验,总结了新手学习 AIGC 图像与视频时常犯的三大误区:死磕参数、只看教程不动手、盲目追逐新工具。他提出了先跑通全流程、以 Prompt 工程为核心、带着项目学习的三大思路。此外,文章还展示了利用蚂蚁百灵 Ring-2.6-1T 模型规划并生成的一个完整 AIGC 学习路径网站,该路径分为认知启蒙、工具上手、Prompt 工程等六个阶段。 技术 › AIGC ✍ Adam也叫吉米🕐 2026-05-18 AIGC学习路径Prompt工程图像生成视频生成AI绘画MidjourneyStable Diffusion实战经验方法总结
Z Zero to AI Engineer — The Roadmap Nobody Explains Properly 本文提供了一个为期14周的实战型AI工程师学习路线图,旨在解决初学者“只学不做”的困境。文章从环境搭建开始,详细列出了从AI基础、机器学习、深度学习到现代LLM工程及Agent开发的最佳免费资源(如OpenAI/Anthropic官方课程、Karpathy的教程等)。路线强调通过GitHub项目实践来理解原理,最终掌握部署与评估技能,真正从零开始构建可用的AI系统。 技术 › LLM ✍ Shruti Codes🕐 2026-05-17 AI工程师学习路线LLMAgent深度学习RAG实战教程机器学习OpenAIAnthropic
P Prompt as Code:提示词小子的九阴真经 文章提出将提示词视为代码而非自然语言的理念,强调结构化、模块化和版本控制的重要性。通过对比散文式与结构化提示词的差异,展示了如何利用组件化思维、单变量调试法和工程化管理来提升AI图像生成的可控性与效率,旨在帮助创作者建立可复用、可迭代的Prompt体系。 技术 › LLM ✍ block0🕐 2026-05-15 Prompt工程AIGC工程化思维方法论图像生成结构化提示词组件化版本控制效率技巧
我 我写提示词时,不再只靠感觉了 文章探讨了提升AI提示词(Prompt)质量的思考,对比了“情绪法”与“结构法”的区别。作者指出,单纯依赖情绪词汇虽能营造氛围但缺乏稳定性,而结构法通过定义载体、光线、构图等参数确保结果可控。最终提倡“混合法”,即用结构锁定画面骨架,再用情绪补足灵魂,将提示词从“许愿文”转化为精准的“视觉合同”。 技术 › LLM ✍ VoxCat🕐 2026-05-14 提示词提示词工程AIGC图像生成结构法情绪法工作流技巧