【AI画图】一、stable diffusion的发展史
一、stable diffusion的发展史本文目的:学习交换 对于熟悉SD的同砚,一起学习和交换使用过程中的本领和心得。 资助新手
资助没有实行过SD但又对它感爱好的同砚快速入门,而且可以或许独立天生以上效果图。
1.发展史先容:
[*]2015年的时间,有几位大佬基于非均衡热力学提出了一个纯数学的天生模子 (Sohl-Dickstein et al., 2015)。不外谁人时间他们没有效代码实现,以是这篇工作并没有火起来。
[*]2019年斯坦福大学(Song et al)与2020年谷歌大脑 (Ho et
al)根据15年发布的文章,编写了两篇论文,但是影响范围并不是很大。
[*]2020年谷歌大脑的几位大佬又把这个模子实现了出来,由于这个模子一些极其良好的特性,以是它如今火了起来。
[*]2022年9月初,AIGC 进入大众视野里程碑的一件事,下面这幅使用 MidJourney 天生的数字油画《空间歌剧院》
https://dis.qidao123.com/imgproxy/aHR0cHM6Ly9pLWJsb2cuY3NkbmltZy5jbi9ibG9nX21pZ3JhdGUvY2RiMjdmYjkxMWU0MmNjMzU1YmFkZjI2NjIxNWY1ODUud2VicD94LWltYWdlLXByb2Nlc3M9aW1hZ2UvZm9ybWF0LHBuZyNwaWNfY2VudGVy
在美国科罗拉多州展览会 (Colorado State Fair) 的艺术比赛中夺得了第一名,之后大赛评委并未对该幅作品举行改判,并以为纵然它是 AI 天生的作品,也仍旧配得上如许的效果,这一消息被报道后引发了圈表里的广泛讨论。
AI是否应该与人同台竞争,确实须要进一步探究,但真正吸引公众眼光的,着实是AI画作的显现出的超高水平:无论是《空间歌剧院》还是《大西洋月刊》的几幅AI插画,都到达了足以以假乱真的地步,无论是构图、线条还是色彩,都很天然流畅,并没有刻板印象中的呆板呆板。人们惊奇地发现,AI作画已经发展到了不可思议的地步。
AIGC工具对比
在现在的三大新兴文本转图像模子中,Stable Diffusion诞生得最晚,但由于拥有发展良好的开源社区,它的用户关注度和应用广度都逾越Midjourney和DALL-E。
DALL-E
2021 年 1 月,OpenAI 推出了 DALL-E 模子,通过 120 亿参数版本的 GPT-3 Transformer 模子来明白天然语言输入并天生相应的图片。但是它的推出告急用于研究,以是访问权限仅限于小部门测试版用户。这个模子不稳固对于细节明白处置惩罚不美满,且会出现严肃的逻辑大概究竟错误,但是作为开创者,还是得专门提出来的。
在发布 DALL-E 时还发布了 CLIP (Contrastive Language-Image Pre-training,对比图文预训练)。CLIP 是一种神经网络,为输入的图像返回最佳的标题。它所做的变乱与 DALL-E 所做的相反 —— 它是将图像转换为文本,而 DALL-E 是将文本转换为图像。引入 CLIP 的目的是为了学习物体的视觉和笔墨体现之间的接洽。
2022 年 4 月,OpenAI 发布了新版本的 DALL-E 2 ,它是 DALL-E 的升级版本,别的能对所天生的图像举行二次编辑,如今纵然是新用户也须要充值才气天生新图。
MidJourney
MidJourney 的 v1 是 2022 年 2 月发布的,它火出圈是由于 22 年 7 月份的 v3 版本。
它的特点是综合本领比力全面,艺术性很强,非常像艺术家制作的作品,别的图像天生速率更快,早期告急是很多艺术家会借助 Midjourney 作为创作灵感。别的,由于 Midjourney 搭载在 Discord 频道上,以是有非常良好的社区讨论情况和用户底子。
第二次火着实就是本年 3 月份发布 V5, 官方说这个版本在天生图像的人物真实水平、手指细节等方面都有了显着改善,而且在提示词明白的精确性、审美多样性和语言明白方面也都取得了进步。
https://dis.qidao123.com/imgproxy/aHR0cHM6Ly9pLWJsb2cuY3NkbmltZy5jbi9ibG9nX21pZ3JhdGUvMzViYmY1Yjk3ZDY0MDczMWZmYzU1M2Y3M2UxZjIzNjYucG5nI3BpY19jZW50ZXI=
Stable Diffusion
Stable Diffusion 算法上基于 2021 年 12 月提出的潜伏扩散模子(LDM / Latent Diffusion Model)和 2015 年提出的扩散模子(DM / Diffusion Model,它是基于 Google 的 Transformer 模子),以是名字里有 Diffusion,我猜 Stable 体现如今算法已经稳固下来了。
2022年7月Stable Diffusion的问世则震动了环球,相比先辈们,Stable Diffusion已经乐成的办理了细节及服从题目,通过算法迭代将AI画图的精致度提拔到了艺术品级别,并将生产服从提拔到了秒级,创作所需的装备门槛也被拉到了民用水准。
2022年8月对于AI画图来说,革命性的时间已经到临,也得益于Stable Diffusion的开源性子,环球AI画图产物迎来了日新月异的发展。这次AI创作大讨论,正是公众们直观地感受到了技能海潮带来的影响,AI画图正在走进千家万户,舆论高潮也随之而来。
2023 年 4 月,Stability AI 发布了 Beta 版本的 Stable Diffusion XL ,并提到在训练竣事后参数稳固后会开源,并改善了须要输入非常长的提示词 (prompts),对于人体结构的处置惩罚有瑕疵,常常出现动作和人体结构非常。
https://dis.qidao123.com/imgproxy/aHR0cHM6Ly9pLWJsb2cuY3NkbmltZy5jbi9ibG9nX21pZ3JhdGUvM2FhN2RkYTNhNDk0OGY1ODM5MzhkOWE1ZWEyOTdjOWYucG5nI3BpY19jZW50ZXI=
MidJourney 和 Stable Diffusion 的对比
在现在的三大新兴文本转图像模子中,Stable Diffusion诞生得最晚,但由于拥有发展良好的开源社区,它的用户关注度和应用广度都逾越Midjourney和DALL-E。
1.代价
MidJourney 毕竟是为了红利的,远不如本身摆设到本身服务器的开销要低。SD 完胜
友爱水平。MidJourney 新手友爱,注册即用,相对的 SD 须要有肯定技能配景,乃至可以说筹划师大概艺术创作者本身不具备摆设本领。SD 小胜
2.功能
SD 除了支持 MidJourney 全部功能外还支持添补修复、自界说模子。SD 小胜
3.对细节的控制
类似于苹果 (MidJourney) 和安卓 (SD) 的区别,MidJourney 是商业产物,你无法相识它的背后的原理和代码逻辑,以是可控性差、细节优化难 (乃至越调越差),而 SD 由于是开源的且有强盛的社区和相干的模子、扩展等,可以实现本地私有化摆设,还可以或许精准局部调优,控制风格,SD 完胜的。
4.提示方法
Midjourney 是天然语言输入 (直接笔墨表达需求),而 SD 是各种带权重的提示词输入。SD 的提示词本文黑白常磨练输入者本领的,Midjourney 小胜。
5.效果
总体上以为 MidJourney 的图更风雅一点点,但是作为非算法开发者,我感觉 SD 现在输在模子训练的素材和方法上。MidJourney 小胜。
6.善于的画风
MidJourney 留意表达和对细节的渲染,而 Stable-Diffusion 偏写实,假如你想艺术创作,MidJourney 更好,假如你已经有具体的需求,SD 更好。
AI绘画的突破对人类意味着什么
2022年的AI范畴,基于文本天生图像的AI绘画模子是风头无两的主角。 从2月份的Disco Diffusion开始,4月 DALL-E 2和MidJourney约请内测,5月和6月Google发布两大模子Imagen 和Parti(不开放内测只有论文,感觉略水),然后7月尾,Stable Diffusion横空出世。
现在最新AI绘画的”创造力”开始追赶乃至几已比肩人类,这大概进一步打击了人类的尊严,从围棋阿法狗开始,人类在”聪明”这个点的尊严领地已经越来越小,而AI绘画的突破性希望则进一步把人类”想像力”和”创造力”的尊严都打碎了 — 大概还没完全破碎,但已经布满裂缝风雨飘摇。
作者不停对人类的科技发展保持某种中性见解: 只管我们留意于科技让人类的生存变得更优美,但究竟上正如核弹的发明,有些科学技能的出现是中性的,也大概是致命的。 完全取代人类的超等AI从实践来看似乎是一件越来越大概的变乱。 人类须要思索的是,在不太远的将来,我们在全部范畴面临AI都落荒而逃的时间,怎样保持对天下的主导权。
有个朋侪说的很对,假如AI终极学会了写代码 — 似乎没有什么肯定的壁垒在克制这件事的发生 –那么影戏闭幕者的故事大概就要发生了。 假如如许太灰心,那么人类至少要思量,怎样与一个逾越本身全部聪明和创造力的AI天下相处。
固然咯,乐观的角度而言,将来的天下只会更优美:人类通过AR/VR接入同一的大概个人的元宇宙,人类主人只要动动嘴皮子,无所不能的AI助理就能根据要求主动天生内容,乃至直接天生可供人类体验的故事/游戏/捏造生存。
这是一个更优美的盗梦空间,还是一个更优美的黑客帝国?
页:
[1]