DALL·E 2(内含扩散模子先容)【论文精读】Hierarchical Text-ConditionalImage Generation with CLIP Latents

[复制链接]
发表于 2026-4-24 09:02:21 | 显示全部楼层 |阅读模式

马上注册,结交更多好友,享用更多功能,让你轻松玩转社区。

您需要 登录 才可以下载或查看,没有账号?立即注册

×
1官方对模子的先容

         各人好,本日我们就一起来看一下两个月之前 OpenAI 刚放出来的一篇力作。DALL·E 2是 OpenAI 一系列文本图像天生工作的最新一篇。客岁 1 月份他们先推出了Dolly,然后在年底的时间又推出了glide。然后如今 4 月份刚推出了 DALL·E 2 一出来实在网友就已经炸开了锅。我记得那两天的 Twitter 上大概说 Instagram 上随处都是DALL·E 2天生的图片,全部的论坛上根本都被DALL·E 2刷屏了。固然网上有很多很好玩的很新奇的天生了一些图片。但是OpenAI这里本身做的这个DALL·E 2先容更黑白常精致。以是我们就先来看看它是怎么宣转达力兔的。作者上来先说 Dolly two 是可以根据这个文本形貌去天生这种原创性的真实的图片。
         这个原创性很告急,由于各人经常以为你这个模子是不是在很多很多的这个数据上练习之后,它实在就是把这些图片记取了,然后接下来它就不绝地复制粘贴去天生新的图片而已。但是作者这里以为 Dolly two 是能天生原创性的图片的,也就是说是这种FAKE image 是从来没有在练习机里出现过的图片。然后作者接下来。说, Dolly two 是真的把图片文本里那些特性都学到了,以是说它可以恣意的去组合这种概念大概属性,大概这种风格。然后接下来 open i 就举了几个例子,那左边就是这个文本形貌,从上到下一共有三行,分别对应的就是这个概念、属性和风格。那比如说我们如今如果选定一个宇航员骑着一匹马,而且是这种写实的风格,那它就会天生像右图如许的图片,我们可以看出这个图片的语义实在和这个文本形貌非常的贴切,而且这个细节也非常的逼真。那如果我们如今换一下这些概念大概风格会怎么样?比如说我们如今换一下一碗汤,然后属性酿成了去别的一个空间的传送门,然后风格就是一副数字画,然后 Dolly 就能天生这么一张图片真的是让人瞠目结舌。这个实在都可以直接拿去做插画大概当任何广告的这个宣传画了。那末了我们再看一个例子,如果我们把最上面这个概念换成Teddy bear。然后属性就是说。他们正在做最新的这种 AI 研究,然后风格就是在 1980 年代的谁人月球上,DALL·E 2就真的可以大概天生有两只 Teddy bear,然后在电脑跟前做什么工作。而且是在月球外貌。这个天生效果真的黑白常的不可思议。
         那除了根据文本直接去天生图片之外,那 OpenAI 这里说 Dolly two 还能做的变乱就是根据文本去对已有的这个图片举行编辑和修改。它可以恣意添加大概移除如今图片里的物体,而且乃至可以大概把这些阴影光的反射,另有这些物体的纹理全都思量在内。这里作者又举了几个例子,比如说左边这张图片是一个室内的一个大厅,然后他如今文本就给这对应的这一二三个位置上去添加一只火烈鸟。那如今如果我们把这个火烈鸟添加的位置改成3,那我们可以看一下,诶,就在 3 的这个位置上就天生了两只火烈鸟。而且dollytwo 的这个天生它不是一对一映射关系的。由于它利用的是一种叫扩散模子的结构去做这种图像天生,以是它可以天生恣意多的图像,但是大要内容都差不多。只不外具体的细节不太一样。那作者这里还给了很多别的例子,比如说它天生的里头也有一只火烈鸟,大概说另有脖子更长的火烈鸟。而且这里我们可以留意到这里的火烈鸟其着实水里另有倒影。那更神奇的是如果我们把如今火烈鸟添加的位置改成这个位置2。我们就会发现模子实在是在这个水面上放了一个火烈鸟形状的游泳圈。这天生效果实在也是很公道的。由于一样平常在室内的这种泳池大概水面上不太大概会出现真的火烈鸟。每每是这种火烈鸟形状的游泳圈。那如今如果我们再换一个场景,比如说换到这个室内大厅内里,文本形貌是添加一个沙发。我们就会发现DALL·E 2可以天生各式各样的沙发,而且还可以变动颜色。而且还可以变动样式。然后如果我们换一个位置,加到这个 2 的位置,它又会天生新的沙发,但是就是在对应的这个位置之上,瞬间以为实在以后的这个家装计划,家装装修也没有那么难了。给一个平面图想加什么加什么想在哪加。
         然后Dolly。two 还醒目很多变乱。纵然在没有文本输入的情况下, Dolly two 仍旧可以做一些图像天生的工作。比如说这里你给定一张图片,它就可以根据已有的这张图片和它的风格去天生很多类似的这种风格的图片,而不改变已有的这个语义。那比如说这张天下名画颠末DALL·E 2的变动之后,就酿成了右边这个样子。而且就像我刚才说的一样, Dolly two 这个模子不是一个一对一的影射,它实在是可以天生很多种类似的图片的。比如这里人头的方向改变了,然后这这里头巾的样式改变了。固然人的长相一样平常也都有玄妙的改变。如果这里我们再看别的一幅天下名画,这个星期日的下战书。我们就可以看到DALL·E 2真的是真实的模拟了这种风格,然后又天生了很多很多种如许差别的图片。以是说在Dolly two 这个工作出来之后, OpenAI 的 CEO 本人都在。Twitter 上说。他以为他之前对 a i 的明确大概有都有了错误。由于我们不绝以为 a i 是可以大概先处置处罚这种就是重复性的工作,体力工作。而这种带有创造性的工作每每是 AI 无法代替的。但在如今看来,这种艺术的创作反而好像已经触手可及了。
2天生效果对比

         那在作者卖完了这些最惊艳的效果之后。作者就把Dolly two 跟大力大肆的这个天生效果对比了一下。那这里这个例子就是用同样的文本天生的两张图片,我们可以看到 Dolly two 可以天生之前四倍的这个分辨率,以是说看起来更清晰也更逼真了。那如果光拿一张图举例,各人大概不信。以是作者这里。又做了别的一个实验。就是他找了一些志愿者,然后让这些志愿者看1000张图片。那分别是Dolly天生的和 Dolly two 天生的。那末了统计的效果就是有70%。的人以为 Dolly two 天生的图片跟这个文本形貌更贴切,然后有快要 90% 的人以为达利兔天生的图片要比达利天生的图片要更真实。
3安全性思量

         末了。又是老生常谈 OpenAI 经常搞这个大模子、大数据这个东西,然后到末了他就跟你来谈一谈这个安全思量大概道德公平性伦理这种思量。它这里就说我们暂时还不能开源,也不能 release 我们的模子,我们乃至连API都不开放。如今 OpenAI 就只是把它们的 API 开放给了一小部门用户,然后让他们去做这种内测大概做一些研究,看看DALL·E 2到底有什么缺陷,有什么限定。那实在作者这里说的这些安全思量,重要就是说怕用户去天生这种带有暴力的大概成人的,大概带有政治色彩的这些图片。固然了,网上网络的这种图像文本对肯定会带有很多这种私见和公平性的题目。那如果你如今以为 Dolly two 很吸引你,然后想去玩一下的话,那你就可以到场 Dolly two 的这个waiting list。但是这个 waiting list 应该很长,我也早在一个半月之前就申请了,但是至今没什么消息。从 Twitter 和 Reddit 利用的情况来看, open i 重要是把优先权给了那些大v,说白了就是让他们去给DALL·E 2做这种免费的宣传。那对于大部门。没有排上 waiting list 的小搭档来说如果你非常想实验一下大力大肆模子。那这里实在 GitHub 上有一个开源的大力大肆库,叫做 Dolly Mini,如今我们可以看到它的 star 也已经有 9000 个了,固然它的模子都是在比力小规模的数据集上去练习,而且模子本身也比力小,以是说末了的效果不是那么好。但是玩起来已经很故意思了。这里你。固然可以把他的代码下来,在你当地上去跑,大概你就像他这里说的一样,打开这个Colab,然后在Colab里去用。那再大概最简朴的一个方式就是直接用APP。也就是它这里最上面说的这个 hugging face 的这个应用。那 hugging face 各人肯定都不。陌生了。算是如今最盛行的 NLP 的开源库,而且已经徐徐有酿成 CV 乃至多模态里它最盛行的库的趋势。那 hugging face。这边它就提供一个东西叫space,就是一个空间。然后各人可以把它的模子代码上传到这个上面,就可以做成一个APP,然后各人就可以直接来玩儿。比如这里就是一个 Darling mini 的一个应用APP。各人就可以。随意把你的这个文本写在这个文本框里,然后点一下这个wrong,底下就会出来很多这个 Dolly mini天生的图片。这里由于太多人玩了,以是经常排不上队,我就提前体验了一下,我如今可以把我跑的例子跟各人分享一下。比如这里我的第一个例子就是有一只狗在月球上奔驰。我们可以看到这个模子小了确实照旧不可,天生的这个画质照旧渣了不少。但是它大概天生的这个意思照旧在那下一个例子就是一只狗和一只猫在打架。那这些图片。里也根本都有一只狗和一只猫在对峙,但是这里话就比力抽象,没有那么的写实。比如说这里是个狗头旁边接了两个这种身子,一个白色一个黄色,你也不知道他接的是哪个。然后下面这张图看着猫好像是在打架的样子,但是这个猫脸也没有了,对团体上照旧比力糙的。然后再来天生一张实物的照片,就是边吃拉面边吃Sushi。这里天生这些图片质量还不错,大概是由于这个例子比力简朴,由于它就是两个物体,拉面和 Sushi 都是比力常见的物体,以是说天生的也就比力逼真。然后末了就是在亚马逊 AWS 种西红柿,但是模子应该还不明确什么是AWS,对,它就是把西红柿画出来了。这个在DALL·E 2本文里也有先容,就是当这个文本太过复杂,场景太过复杂的时间,实在模子照旧会选择一个最简朴的场景,然后把它天生出来。
4跟进工作

        那岂论是。OpenAI 天生的这种精致的高清大图照旧我用Dolly mini 天生的这种画质比力糙的小图片,总之 Dolly 系列的工作这种根据文本去天生图像的质量还黑白常好的,而且可以说是出人料想的好。以是自从Dolly在 21 年 1 月份出来之后,后续就有一大堆工作举行跟进。

      
  • 比如说在21 年 5 月份的时间,清华就推出了 cogview 这个模子,它还支持中文去天生图像。  
  • 然后到 11 月份的时间,微软和北大就推出了这个女娲模子不光能天生图像而且还能天生比力短的视频。然后到 12 月份。open i 本身又推出了 Glide 这个模子,也就是我们本日DALL·E 2重要基于的这个图像。天生的模子。我们一会也会提到。  
  • 然后同样在 12 月,百度也推出了 Ernie Vog 这个模子,它也支持中文,而且它这个模子也非常大,有 100 亿参数,根本跟最开始这个大力大肆 120 亿参数就非常靠近了。  
  • 然后转眼来到本年 4 月份的时间, open i 又推出。了DALL·E 2。  
  • 然后同样在4月,清华又再次推出了 cogview two,紧接着一个月之后,他又推出了 COG video,就专门针对天生视频做的。  
  • 末了就在上个月, Google 也不甘示弱推出了他们本身的Imagen。 Imagen 实在相对而言模子要简朴很多,而且效果也跟大力大肆平分秋色,乃至很多人都以为 Imagen 的效果更好。但是实在Imagen 和 Dolly two 所用的模子都差不多,它们的底层都是用了扩散模子去做这种图像的天生
        以是说扩散模子真的是一个很火的方向,预感到将来几年根本上它就要代替干的这个位置,由于 Gan 实在已经没有什么可以做的了,已经被人做了五六年了,该发掘的东西全都已经发掘完了。扩散模子作为新起之秀,有太多太多可以进步的地方。如今扩散模子的状态根本就跟 1718 年时间谁人 Gan 的状态差不多。以是应该至少另有两到三年的时间去充实发挥它的潜力。
5标题 Hierarchical Text-ConditionalImage Generation with CLIP Latents

         那前面说了这么多,接下来我们言归正传,一起来精读一下DALL·E 2这篇论文。起首我们看一下标题。作者说利用 clip 练习好的这种特性来做这种层级式的,依托于文本的图像天生。
      
  • 这里层级式的意思是由于 Dolly two 的这个模子是老师成一个小分辨类的图片,比如说 64 * 64,然后再利用一个模子上采样到256 *256。然后再利用一个模子上采样到 1024 * 1024,酿成一个高清大图。以是是一个层级式的结构。  
  • 然后DALL·E 2本身完成的任务就是根据提供的这个文本,从而去天生这个新的图像。那至于利用CLIP 提供的这个特性,实在DALL·E 2这个模子是先练习好了一个 CLIP 模子,然后找到图片和文本对之间的这种相连关系之后,这个时间给定一个文本, CLIP的文本编码器就可以把这个文本酿成一个文本特性,然后 Dolly two 就练习一个prior 模子。这个模子的输入是这个文本特性,然后它的输出是这个图像特性。然后再把这个图像特性给接下来的这个解码器,从而天生一个完备的图像。以是说整个大力大肆图模子是离不开CLIP特性的。
         作者团队都来自OpenAI,各人应该都很熟悉了。这里的一作, Adida 实在加入过clip 和Dolly的工作。mark 也是 Dolly 的原班作者,而且它重要是做 Codex 和 GPT 3 的。但是由于大力大肆兔这篇论文,它这个图像解码部门重要用的是 diffusion model,就这个扩散模子,以是说又找了两个扩散模子的这个专家。他们做过iGPT,而且迩来刚写过 improved DDPM 这篇论文,也就是 denosing diffusion model,以是把扩散模子玩儿的是很溜。以是一会儿我们也可以看到 Dolly two 这个模子,实在就是 CLIP 模子加上 Glide 模子,而 Glide 模子就是一个基于扩散模子的文本图像天生的方法。那从作者这里也可以看出来,就是 CLIP 的作者加上Glide 的作者。
6论文结构

         那在精读论文之前,我们先来看一下文章的团体结构大力大肆 two 这篇论文实在不长,跟 clip 的四五十页比起来,大力大肆 two 实在只有 27 页。如果你把背面的这些可视化,另有这些参考文献都去掉的话,实在也就十几页,而且全文这些图确实都比力多。
      
  • 然后论文上来先是说择要,  
  • 然后是弁言,然后在弁言部门贴了 9 个高清大图,就展示了一下他们天生的这种 1024 * 1024 的这些大图到底画质有多么的好。  
  • 然后接下来就是达利兔论文的这个主体方法部门,实在只有短短的两页,然后在这里作者乃至都没有去讲clip,他以为你已经知道 clip 是什么了,重要就讲的是它背面图像天生这一部门。比如说这里它就先讲了一下 decoder 这个解码器。下面就讲了一下这个 prior 先验模子。  
  • 然后接下来作者就大概用了四五页的篇幅去先容一下DALL·E 2到底醒目什么?  
  • 然后又用了四五页的篇幅去跟别的方法做了一些对比,不光是数字上的对比,另有可视化上的这种对比。  
  • 然后末了写了一下相干工作,  
  • 最故意思的就是末了几页,他形貌了一下 DALL·E 2 two 的这个如今的范围性和不敷。实在当我们末了看到这些不敷的时间,我们会发现实在DALL·E 2图另有很多必要进步的地方。它远远没有我们看到的那几张图片一样那么惊艳。  
  • 接下来是参考文献,  
  • 这里是一些具体的这个练习细节,  
  • 末了又展示了一下,根据同样一个文本,它可以大概天生差别的输出,而且每一张输出的图片都非常清晰和逼真。
7择要

         那接下来我们直接看择要作者上来说之前的那些对比学习的方法,比如说我们 open i 本身的 CLIP 模子,这种模子已经可以学习到很妥当的一个图像特性。它既可以大概捉住这个语义信息,又能捉住这个图像的这个风格信息那既然这个特性这么好,这么妥当,那如果你只拿它去做这种分类任务就有点惋惜。以是作者接下来说,为了可以大概借助于这些特性,然后能用来做这个图像天生。我们提出了一个两阶段的一个模子,这两个阶段分别叫 prior 和这个 decoder ,prior就是给定一个文本形貌,它可以大概给我天生一个类似于 clip 的一个图像特性。然后解码器的意思就是说当你给定这个图像特性之后,我能根据这个特性天生一个图像。
        以是这个过程。实在说直白点儿就是给定一个文本,然后我先用一个 clip 模子把它天生一个文本的特性。这一步是固定的,由于这里这个 clip 模子是锁死的。然后接下来就到文章说的这个两阶段的模子,它根据这个文本特性去天生一个图像特性,这一步就叫做prior。固然 clip 模子在这里也有效了,由于 clip 天生的谁人对应的图像特性是用来在这里做 ground truth 用。
        然后你一旦有了这个图像特性,我就必要有一个这个解码器去天生末了的这个图像,然后就完成了这个从文本到图像的天生过程。
回复

使用道具 举报

登录后关闭弹窗

登录参与点评抽奖  加入IT实名职场社区
去登录
快速回复 返回顶部 返回列表