各人好,本日我们就一起来看一下两个月之前 OpenAI 刚放出来的一篇力作。DALL·E 2是 OpenAI 一系列文本图像天生工作的最新一篇。客岁 1 月份他们先推出了Dolly,然后在年底的时间又推出了glide。然后如今 4 月份刚推出了 DALL·E 2 一出来实在网友就已经炸开了锅。我记得那两天的 Twitter 上大概说 Instagram 上随处都是DALL·E 2天生的图片,全部的论坛上根本都被DALL·E 2刷屏了。固然网上有很多很好玩的很新奇的天生了一些图片。但是OpenAI这里本身做的这个DALL·E 2先容更黑白常精致。以是我们就先来看看它是怎么宣转达力兔的。作者上来先说 Dolly two 是可以根据这个文本形貌去天生这种原创性的真实的图片。
这个原创性很告急,由于各人经常以为你这个模子是不是在很多很多的这个数据上练习之后,它实在就是把这些图片记取了,然后接下来它就不绝地复制粘贴去天生新的图片而已。但是作者这里以为 Dolly two 是能天生原创性的图片的,也就是说是这种FAKE image 是从来没有在练习机里出现过的图片。然后作者接下来。说, Dolly two 是真的把图片文本里那些特性都学到了,以是说它可以恣意的去组合这种概念大概属性,大概这种风格。然后接下来 open i 就举了几个例子,那左边就是这个文本形貌,从上到下一共有三行,分别对应的就是这个概念、属性和风格。那比如说我们如今如果选定一个宇航员骑着一匹马,而且是这种写实的风格,那它就会天生像右图如许的图片,我们可以看出这个图片的语义实在和这个文本形貌非常的贴切,而且这个细节也非常的逼真。那如果我们如今换一下这些概念大概风格会怎么样?比如说我们如今换一下一碗汤,然后属性酿成了去别的一个空间的传送门,然后风格就是一副数字画,然后 Dolly 就能天生这么一张图片真的是让人瞠目结舌。这个实在都可以直接拿去做插画大概当任何广告的这个宣传画了。那末了我们再看一个例子,如果我们把最上面这个概念换成Teddy bear。然后属性就是说。他们正在做最新的这种 AI 研究,然后风格就是在 1980 年代的谁人月球上,DALL·E 2就真的可以大概天生有两只 Teddy bear,然后在电脑跟前做什么工作。而且是在月球外貌。这个天生效果真的黑白常的不可思议。
那除了根据文本直接去天生图片之外,那 OpenAI 这里说 Dolly two 还能做的变乱就是根据文本去对已有的这个图片举行编辑和修改。它可以恣意添加大概移除如今图片里的物体,而且乃至可以大概把这些阴影光的反射,另有这些物体的纹理全都思量在内。这里作者又举了几个例子,比如说左边这张图片是一个室内的一个大厅,然后他如今文本就给这对应的这一二三个位置上去添加一只火烈鸟。那如今如果我们把这个火烈鸟添加的位置改成3,那我们可以看一下,诶,就在 3 的这个位置上就天生了两只火烈鸟。而且dollytwo 的这个天生它不是一对一映射关系的。由于它利用的是一种叫扩散模子的结构去做这种图像天生,以是它可以天生恣意多的图像,但是大要内容都差不多。只不外具体的细节不太一样。那作者这里还给了很多别的例子,比如说它天生的里头也有一只火烈鸟,大概说另有脖子更长的火烈鸟。而且这里我们可以留意到这里的火烈鸟其着实水里另有倒影。那更神奇的是如果我们把如今火烈鸟添加的位置改成这个位置2。我们就会发现模子实在是在这个水面上放了一个火烈鸟形状的游泳圈。这天生效果实在也是很公道的。由于一样平常在室内的这种泳池大概水面上不太大概会出现真的火烈鸟。每每是这种火烈鸟形状的游泳圈。那如今如果我们再换一个场景,比如说换到这个室内大厅内里,文本形貌是添加一个沙发。我们就会发现DALL·E 2可以天生各式各样的沙发,而且还可以变动颜色。而且还可以变动样式。然后如果我们换一个位置,加到这个 2 的位置,它又会天生新的沙发,但是就是在对应的这个位置之上,瞬间以为实在以后的这个家装计划,家装装修也没有那么难了。给一个平面图想加什么加什么想在哪加。
然后Dolly。two 还醒目很多变乱。纵然在没有文本输入的情况下, Dolly two 仍旧可以做一些图像天生的工作。比如说这里你给定一张图片,它就可以根据已有的这张图片和它的风格去天生很多类似的这种风格的图片,而不改变已有的这个语义。那比如说这张天下名画颠末DALL·E 2的变动之后,就酿成了右边这个样子。而且就像我刚才说的一样, Dolly two 这个模子不是一个一对一的影射,它实在是可以天生很多种类似的图片的。比如这里人头的方向改变了,然后这这里头巾的样式改变了。固然人的长相一样平常也都有玄妙的改变。如果这里我们再看别的一幅天下名画,这个星期日的下战书。我们就可以看到DALL·E 2真的是真实的模拟了这种风格,然后又天生了很多很多种如许差别的图片。以是说在Dolly two 这个工作出来之后, OpenAI 的 CEO 本人都在。Twitter 上说。他以为他之前对 a i 的明确大概有都有了错误。由于我们不绝以为 a i 是可以大概先处置处罚这种就是重复性的工作,体力工作。而这种带有创造性的工作每每是 AI 无法代替的。但在如今看来,这种艺术的创作反而好像已经触手可及了。
2天生效果对比
那在作者卖完了这些最惊艳的效果之后。作者就把Dolly two 跟大力大肆的这个天生效果对比了一下。那这里这个例子就是用同样的文本天生的两张图片,我们可以看到 Dolly two 可以天生之前四倍的这个分辨率,以是说看起来更清晰也更逼真了。那如果光拿一张图举例,各人大概不信。以是作者这里。又做了别的一个实验。就是他找了一些志愿者,然后让这些志愿者看1000张图片。那分别是Dolly天生的和 Dolly two 天生的。那末了统计的效果就是有70%。的人以为 Dolly two 天生的图片跟这个文本形貌更贴切,然后有快要 90% 的人以为达利兔天生的图片要比达利天生的图片要更真实。
3安全性思量
末了。又是老生常谈 OpenAI 经常搞这个大模子、大数据这个东西,然后到末了他就跟你来谈一谈这个安全思量大概道德公平性伦理这种思量。它这里就说我们暂时还不能开源,也不能 release 我们的模子,我们乃至连API都不开放。如今 OpenAI 就只是把它们的 API 开放给了一小部门用户,然后让他们去做这种内测大概做一些研究,看看DALL·E 2到底有什么缺陷,有什么限定。那实在作者这里说的这些安全思量,重要就是说怕用户去天生这种带有暴力的大概成人的,大概带有政治色彩的这些图片。固然了,网上网络的这种图像文本对肯定会带有很多这种私见和公平性的题目。那如果你如今以为 Dolly two 很吸引你,然后想去玩一下的话,那你就可以到场 Dolly two 的这个waiting list。但是这个 waiting list 应该很长,我也早在一个半月之前就申请了,但是至今没什么消息。从 Twitter 和 Reddit 利用的情况来看, open i 重要是把优先权给了那些大v,说白了就是让他们去给DALL·E 2做这种免费的宣传。那对于大部门。没有排上 waiting list 的小搭档来说如果你非常想实验一下大力大肆模子。那这里实在 GitHub 上有一个开源的大力大肆库,叫做 Dolly Mini,如今我们可以看到它的 star 也已经有 9000 个了,固然它的模子都是在比力小规模的数据集上去练习,而且模子本身也比力小,以是说末了的效果不是那么好。但是玩起来已经很故意思了。这里你。固然可以把他的代码下来,在你当地上去跑,大概你就像他这里说的一样,打开这个Colab,然后在Colab里去用。那再大概最简朴的一个方式就是直接用APP。也就是它这里最上面说的这个 hugging face 的这个应用。那 hugging face 各人肯定都不。陌生了。算是如今最盛行的 NLP 的开源库,而且已经徐徐有酿成 CV 乃至多模态里它最盛行的库的趋势。那 hugging face。这边它就提供一个东西叫space,就是一个空间。然后各人可以把它的模子代码上传到这个上面,就可以做成一个APP,然后各人就可以直接来玩儿。比如这里就是一个 Darling mini 的一个应用APP。各人就可以。随意把你的这个文本写在这个文本框里,然后点一下这个wrong,底下就会出来很多这个 Dolly mini天生的图片。这里由于太多人玩了,以是经常排不上队,我就提前体验了一下,我如今可以把我跑的例子跟各人分享一下。比如这里我的第一个例子就是有一只狗在月球上奔驰。我们可以看到这个模子小了确实照旧不可,天生的这个画质照旧渣了不少。但是它大概天生的这个意思照旧在那下一个例子就是一只狗和一只猫在打架。那这些图片。里也根本都有一只狗和一只猫在对峙,但是这里话就比力抽象,没有那么的写实。比如说这里是个狗头旁边接了两个这种身子,一个白色一个黄色,你也不知道他接的是哪个。然后下面这张图看着猫好像是在打架的样子,但是这个猫脸也没有了,对团体上照旧比力糙的。然后再来天生一张实物的照片,就是边吃拉面边吃Sushi。这里天生这些图片质量还不错,大概是由于这个例子比力简朴,由于它就是两个物体,拉面和 Sushi 都是比力常见的物体,以是说天生的也就比力逼真。然后末了就是在亚马逊 AWS 种西红柿,但是模子应该还不明确什么是AWS,对,它就是把西红柿画出来了。这个在DALL·E 2本文里也有先容,就是当这个文本太过复杂,场景太过复杂的时间,实在模子照旧会选择一个最简朴的场景,然后把它天生出来。
4跟进工作
那岂论是。OpenAI 天生的这种精致的高清大图照旧我用Dolly mini 天生的这种画质比力糙的小图片,总之 Dolly 系列的工作这种根据文本去天生图像的质量还黑白常好的,而且可以说是出人料想的好。以是自从Dolly在 21 年 1 月份出来之后,后续就有一大堆工作举行跟进。
比如说在21 年 5 月份的时间,清华就推出了 cogview 这个模子,它还支持中文去天生图像。
然后到 11 月份的时间,微软和北大就推出了这个女娲模子不光能天生图像而且还能天生比力短的视频。然后到 12 月份。open i 本身又推出了 Glide 这个模子,也就是我们本日DALL·E 2重要基于的这个图像。天生的模子。我们一会也会提到。
末了就在上个月, Google 也不甘示弱推出了他们本身的Imagen。 Imagen 实在相对而言模子要简朴很多,而且效果也跟大力大肆平分秋色,乃至很多人都以为 Imagen 的效果更好。但是实在Imagen 和 Dolly two 所用的模子都差不多,它们的底层都是用了扩散模子去做这种图像的天生
以是说扩散模子真的是一个很火的方向,预感到将来几年根本上它就要代替干的这个位置,由于 Gan 实在已经没有什么可以做的了,已经被人做了五六年了,该发掘的东西全都已经发掘完了。扩散模子作为新起之秀,有太多太多可以进步的地方。如今扩散模子的状态根本就跟 1718 年时间谁人 Gan 的状态差不多。以是应该至少另有两到三年的时间去充实发挥它的潜力。
5标题 Hierarchical Text-ConditionalImage Generation with CLIP Latents