Stable Diffusion v3---

[复制链接]
发表于 2026-2-21 17:58:21 | 显示全部楼层 |阅读模式
 留意不是第3集是版本3 
Stable Diffusion 3 和 Sora 一样接纳了 diffusion transformer 架构。Stable Diffusion 3震撼发布,接纳Sora同源技能,笔墨终于不乱码了,它接纳了和爆火Sora同样的DiT架构,画面质量、笔墨渲染、复杂对象明白大提拔,Midjourney、DALL-E 3都显得黯然失色了。
继 OpenAI 的 Sora 一连一周霸屏后,昨晚,天生式 AI 顶级技能公司 Stability AI 也放了一个大招 ——Stable Diffusion 3。该公司表现,这是他们最强大的文生图模子。
与之前的版本相比,Stable Diffusion 3 天生的图在质量上实现了很大改进,支持多主题提示,笔墨誊写效果也更好了。以下是一些官方示例:
提示:史诗般的动漫作品,一位巫师在夜晚的山顶上向黑暗的天空施放宇宙咒语,咒语上写着 "Stable Diffusion 3",由五彩缤纷的能量构成(Epic anime artwork of a wizard atop a mountain at night casting a cosmic spell into the dark sky that says "Stable Diffusion 3" made out of colorful energy)

提示:影戏照片,课堂的桌子上放着一个红苹果,黑板上用粉笔写着 "go big or go home" 的字样(cinematic photo of a red apple on a table in a classroom, on the blackboard are the words "go big or go home" written in chalk) 

提示:一幅画,画中宇航员骑着一只穿着蓬蓬裙的猪,撑着一把粉色的伞,猪旁边的地上有一只戴着高帽的知更鸟,角落里有 "stable diffusion" 的字样(a painting of an astronaut riding a pig wearing a tutu holding a pink umbrella, on the ground next to the pig is a robin bird wearing a top hat, in the corner are the words "stable diffusion")

提示:玄色配景上变色龙的拍照棚特写(studio photograph closeup of a chameleon over a black background

别的,Stability AI 媒体主管也晒出了一些天生效果:
Stability AI 表现,Stable Diffusion 3 是一个模子系列,参数量从 800M 到 8B 不等。这个参数量意味着,它可以在很多便携式装备上直接跑,大大低落了 AI 大模子的利用门槛。
别的,Stability AI 还透露,他们和 Sora 一样,在新模子中接纳了 diffusion transformer 架构,并在博客中链接了 William (Bill) Peebles 和谢赛宁合著的 DiT 论文。这篇论文现在的被引量是 201,本年有望大幅增长。
不外,现在,Stable Diffusion 3 还没有全面开放,权重也没有公布。团队提到,他们正在接纳一些安全步伐,防止非法分子滥用。
想要尝鲜的用户可以点击以下链接提交申请:https://stability.ai/stablediffusion3
该公司首席实验官 Emad Mostaque 在 X 平台的帖子中提到,在得到反馈并举行改进后,他们会把该模子开源。
很多人大概会好奇,这个 Stable Diffusion 3 和 DALL・E 3、Midjourney 比效果怎样?有些人做了测试,看起来好像没有拉开显着差距。不外,Stable Diffusion 3 是开源范畴的渴望。
值得留意的是,在 Stable Diffusion 3 发布的同一时间,外媒还传出了 Stability AI 旗下图像天生应用公司 Clipdrop 被收购的消息。总部位于巴黎的 Clipdrop 建立于 2020 年 7 月,利用开源 AI 模子答应用户天生和编辑照片。在 2023 年 3 月以未披露的金额出售给 Stability AI 之前,它已从 Air Street Capital 筹集了种子投资。其时,Clipdrop 表现它拥有高出 1500 万用户。但仅仅一年之后,Stability AI 就将它卖给了美国写作助理初创公司 Jasper。
有人评价说,Stable Diffusion 3 的发布就是在粉饰这个消息。和很多 AI 创业公司一样,Stability AI 面对的逆境在于其以惊人的速率烧钱,但却没有明白的红利途径。客岁年底,该公司还传出了 CEO 大概被投资者赶下台的消息,公司自己大概也在寻求卖身。在如许的配景下,Stability AI 急迫地必要提振投资者信心。
路透社评价说,这笔交易业务标记着 Stability AI 战略的逆转。Emad Mostaque 在一份电子邮件声明中表现,这笔交易业务将使该公司可以或许继续专注于开辟「尖端的开放模子」。在 Stable Diffusion 3 的相干博客中,该公司也夸大,「我们对确保天生式人工智能开放、安全和广泛可及的答应仍旧刚强不移。」现在看来,Stability AI 的前程仍不清朗。
Stable Diffusion 3 背后的技能
Diffusion Transformer+Flow Matching
在博客中,Stability AI 公布了打造 Stable Diffusion 3 的两项关键技能:Diffusion Transformer 和 Flow Matching。
Diffusion Transformer
Stable Diffusion 3 利用了类似于 OpenAI Sora 的 Diffusion Transformer 框架,而此前几代 Stable Diffusion 模子仅依靠于扩散架构。
Diffusion Transformer 是 Sora 研发负责人之一 Bill Peebles 与纽约大学助理传授谢赛宁最初在 2022 年底发布的研究,2023 年 3 月更新第二版。
论文探究了扩散模子中架构选择的意义,研究表明 U-Net 归纳偏置对扩散模子的性能不是至关告急的,而且可以很容易地用标准计划(如 Transformer)代替。

论文标题:Scalable Diffusion Models with Transformers
论文链接:https://arxiv.org/pdf/2212.09748.pdf
详细来说,论文提出了一种基于 Transformer 架构的新型扩散模子 DiT,并练习了潜伏扩散模子,用对潜伏 patch 举行操纵的 Transformer 更换常用的 U-Net 主干网络。他们通过以 Gflops 衡量的前向转达复杂度来分析扩散 Transformer (DiT) 的可扩展性,各个型号的 DiT 都取得了不错的效果。
我们都知道,扩散模子的乐成可以归功于它们的可扩展性、练习的稳固性和天生采样的多样性。在扩散模子的范围内,所利用的骨干架构存在很大差异,包罗基于 CNN 的、基于 Transformer 的、CNN-Transformer 混淆,乃至是状态空间模子。
用于扩展这些模子以支持高分辨率图像合成的方法也各不雷同,现有方法或是增长了练习的复杂性,或是必要额外的模子,或是捐躯了质量。潜伏扩散是实现高分辨率图像合成的告急方法,但在实践中无法表现风雅细节,影响了采样质量,限定了其在图像编辑等应用中的实用性。其他高分辨率图像合成方法尚有级联超分辨率、多标准丧失、增长多分辨率的输入和输出,或利用自调治温顺应全新的架构方案。
基于 DiT 的启发,Stability AI 进一步提出了 Hourglass Diffusion Transformer (HDiT)。这是一种随像素数量扩展的图像天生模子,支持直接在像素空间举行高分辨率(如 1024 × 1024)练习。
这项工作通过改进骨干网络办理了高分辨率合成题目。Transformer 架构可以扩展到数十亿个参数,HDiT 在此根本上,增补了卷积 U-Net 的服从和 Transformer 的可扩展性之间的差距,无需利用典范的高分辨率练习技能即可乐成举行练习。

论文标题:Scalable High-Resolution Pixel-Space Image Synthesis with Hourglass Diffusion Transformers
论文链接:https://arxiv.org/pdf/2401.11605.pdf
研究者引入了一种「pure transformer」架构,得到了一种可以或许在标准扩散设置中天生百万像素级高质量图像的骨干布局。纵然在 128 × 128 等低空间分辨率下,这种架构也比 DiT 等常见 Diffusion Transformer 骨干网络(图 2)的服从高得多,在天生质量上也具有竞争力。另一方面,与卷积 U-Nets 相比,HDiT 在像素空间高分辨率图像合成的盘算复杂度方面同样具备竞争力。

Flow Matching
利用 Flow Matching 技能的意义则在于提拔采样服从。
深度天生模子可以或许对未知数据分布举行估计和采样。然而,对简朴扩散过程的限定导致采样概率路径的空间相当有限,从而导致练习时间很长,必要接纳专门的方法举行高效采样。在这项工作中,研究者探究了怎样创建一连标准化流的通用确定性框架。   whaosoft aiot http://143ai.com
这项研究为基于一连归一化流(CNF)的天生建模引入了一种新范式,实现了从亘古未有的规模练习 CNF。

论文标题:FLOW MATCHING FOR GENERATIVE MODELING
论文链接:https://arxiv.org/pdf/2210.02747.pdf
详细来说,论文提出了「Flow Matching」的概念,这是一种基于固定条件概率路径向量场回归练习 CNF 的免模拟方法。Flow Matching 与用于在噪声和数据样本之间举行转换的高斯概率路径的通用族兼容(通用族将现有的扩散路径归纳为详细实例)。
研究者发现,利用带有扩散路径的 Flow Matching 可以为扩散模子的练习提供更妥当、更稳固的替换方案。
别的,Flow Matching 还为利用其他非扩散概率路径练习 CNF 打开了大门。此中一个特别值得关注的例子是利用最优传输(OT)位移插值来界说条件概率路径。这些路径比扩散路径更有效,练习和采样速率更快,泛化效果更好。在 ImageNet 上利用 Flow Matching 对 CNF 举行练习,在似然性和采样质量方面的性能始终优于其他基于扩散的方法,而且可以利用现成的数值 ODE 求解器快速、可靠地天生采样。

Stable Video同时发力
别的,就在不久前,Stable Video也正式开放公测了。
背后照旧基于Stable Video Diffusion 1.1。
体验地点:https://www.stablevideo.com/
从前,这个模子必要用户自己上手摆设,现在已经大家可用了,乃至不必要列队!
固然跟登月级的Sora尚有很大差距,但视频效果已经可以和Runway一拼。
参考链接:
https://stability.ai/stablediffusion3
https://www.reuters.com/markets/deals/ai-startup-jasper-acquires-image-generator-clipdrop-stability-ai-2024-02-22/
https://stability.ai/research/hourglass-diffusion-transformer-high-resolution-image-synthesis

#Stable Diffusion 3论文
在浩繁前沿结果都不再透露技能细节之际,Stable Diffusion 3 论文的发布显得相当贵重。
Stable Diffusion 3 的论文终于来了!
这个模子于两周前发布,接纳了与 Sora 雷同的 DiT(Diffusion Transformer)架构,一经发布就引起了不小的轰动。
与之前的版本相比,Stable Diffusion 3 天生的图在质量上实现了很大改进,支持多主题提示,笔墨誊写效果也更好了(显着不再乱码)。
Stability AI 表现,Stable Diffusion 3 是一个模子系列,参数量从 800M 到 8B 不等。这个参数量意味着,它可以在很多便携式装备上直接跑,大大低落了 AI 大模子的利用门槛。
在最新发布的论文中,Stability AI 表现,在基于人类偏好的评估中,Stable Diffusion 3 优于当前开始进的文本到图像天生体系,如 DALL・E 3、Midjourney v6 和 Ideogram v1。不久之后,他们将公开该研究的实验数据、代码和模子权重。
在论文中,Stability AI 透露了关于 Stable Diffusion 3 的更多细节。


  • 论文标题:Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
  • 论文链接:https://stabilityai-public-packages.s3.us-west-2.amazonaws.com/Stable+Diffusion+3+Paper.pdf
架构细节
对于文本到图像的天生,Stable Diffusion 3 模子必须同时思量文本和图像两种模式。因此,论文作者称这种新架构为 MMDiT,意指其处置惩罚多种模态的本领。与之前版本的 Stable Diffusion 一样,作者利用预练习模子来推导符合的文本和图像表征。详细来说,他们利用了三种差异的文本嵌入模子 —— 两种 CLIP 模子和 T5—— 来编码文本表征,并利用改进的自编码模子来编码图像 token。

Stable Diffusion 3 模子架构。

改进的多模态扩散 transformer:MMDiT 块。
SD3 架构基于 Sora 核心研发成员 William Peebles 和纽约大学盘算机科学助理传授谢赛宁相助提出的 DiT。由于文本嵌入和图像嵌入在概念上有很大差异,因此 SD3 的作者对两种模态利用两套差异的权重。如上图所示,这相当于为每种模态设置了两个独立的 transformer,但将两种模态的序列团结起来举行留意力运算,从而使两种表征都能在各自的空间内工作,同时也将另一种表征思量在内。

在练习过程中丈量视觉保真度和文本对齐度时,作者提出的 MMDiT 架构优于 UViT 和 DiT 等成熟的文本到图像骨干。
通过这种方法,信息可以在图像和文本 token 之间活动,从而进步模子的团体明白本领,并改善所天生输出的笔墨排版。正如论文中所讨论的那样,这种架构也很容易扩展到视频等多种模式。

得益于 Stable Diffusion 3 改进的提示依照本领,新模子有本领制作出聚焦于各种差异主题和质量的图像,同时还能高度机动地处置惩罚图像自己的风格。

通过 re-weighting 改进 Rectified Flow
Stable Diffusion 3 接纳 Rectified Flow(RF)公式,在练习过程中,数据和噪声以线性轨迹相连。这使得推理路径更加平直,从而镌汰了采样步调。别的,作者还在练习过程中引入了一种新的轨迹采样筹划。他们假设,轨迹的中心部分会带来更具寻衅性的猜测使命,因此该筹划给予轨迹中心部分更多权重。他们利用多种数据集、指标和采样器设置举行比力,并将自己提出的方法与 LDM、EDM 和 ADM 等 60 种其他扩散轨迹举行了测试。效果表明,固然从前的 RF 公式在少步采样环境下性能有所进步,但随着步数的增长,其相对性能会降落。相比之下,作者提出的重新加权 RF 变体能连续进步性能。

扩展 Rectified Flow Transformer 模子
作者利用重新加权的 Rectified Flow 公式和 MMDiT 骨干对文本到图像的合成举行了扩展(scaling)研究。他们练习的模子从带有 450M 个参数的 15 个块到带有 8B 个参数的 38 个块不等,并观察到验证丧失随着模子巨细和练习步调的增长而安稳低落(上图的第一行)。为了查验这是否转化为对模子输出的故意义改进,作者还评估了自动图像对齐指标(GenEval)和人类偏好分数(ELO)(上图第二行)。效果表明,这些指标与验证丧失之间存在很强的相干性,这表明后者可以很好地猜测模子的团体性能。别的,scaling 趋势没有表现出饱和的迹象,这让作者对将来继续进步模子性能持乐观态度。
机动的文本编码器
通过移除用于推理的内存麋集型 4.7B 参数 T5 文本编码器,SD3 的内存需求可显着低落,而性能丧失却很小。如图所示,移除该文本编码器不会影响视觉美感(不利用 T5 时的胜率为 50%),只会略微低落文本划一性(胜率为 46%)。不外,作者发起在天生书面文本时参加 T5,以充实发挥 SD3 的性能,由于他们观察到,如果不参加 T5,天生排版的性能降落幅度更大(胜率为 38%),如下图所示:

有在出现涉及很多细节或大量书面文本的非常复杂的提示时,移除 T5 举行推理才会导致性能显着降落。上图表现了每个示例的三个随机样本。
模子性能
作者将 Stable Diffusion 3 的输出图像与其他各种开源模子(包罗 SDXL、SDXL Turbo、Stable Cascade、Playground v2.5 和 Pixart-α)以及闭源模子(如 DALL-E 3、Midjourney v6 和 Ideogram v1)举行了比力,以便根据人类反馈来评估性能。在这些测试中,人类评估员从每个模子中得到输出示例,并根据模子输出在多洪流平上依照所给提示的上下文(prompt following)、在多洪流平上根据提示渲染文本(typography)以及哪幅图像具有更高的美学质量(visual aesthetics)来选择最佳效果。

以 SD3 为基准,这个图表概述了它在基于人类对视觉美学、提示依照和笔墨排版的评估中的胜率。
从测试效果来看,作者发现 Stable Diffusion 3 在上述全部方面都与当前开始进的文本到图像天生体系相当,乃至更胜一筹。
在消耗级硬件上举行的早期未优化推理测试中,最大的 8B 参数 SD3 模子适当 RTX 4090 的 24GB VRAM,利用 50 个采样步调天生分辨率为 1024x1024 的图像必要 34 秒。

别的,在最初发布时,Stable Diffusion 3 将有多种变体,从 800m 到 8B 参数模子不等,以进一步消除硬件停滞。
 

 原论文。
参考链接:https://stability.ai/news/stable-diffusion-3-research-paper
 

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

登录后关闭弹窗

登录参与点评抽奖  加入IT实名职场社区
去登录
快速回复 返回顶部 返回列表