这个GAN没见过猪,却能把狗变成猪
丰色发自凹非寺量子位报道|公众号QbitAI
不用成千上万张目标图片训练 , 就能让GAN生成你想要的图片 , 有可能吗?
文章图片
还真有可能!
来自特拉维夫大学和英伟达的研究人员成功地盲训出领域自适应的图像生成模型——StyleGAN-NADA 。
也就是只需用简单地一个或几个字描述 , 一张目标领域的图像也不需要 , StyleGAN-NADA就能在几分钟内训练出你想要的图片:
比如现在在几张狗狗的基础图片上输入“Sketch” , 不到1分钟 , 一张张草图风格狗的图片就出来了 。 (视频没有声音可放心“食用”)
再比如在人像上给出文字“Pixar” , 就能生成皮克斯风格的图片:
文章图片
各种人像风格都可以:
文章图片
甚至把狗变成猪也行:
文章图片
问题来了 , AI不可能生成它完全没有见过的照片 , 但是又不给它参考照片 , 那怎么满足要求呢?
基于CLIP
答案就是借助CLIP的语义能力 。
CLIP是OpenAI提出的根据文字生成图片的DALL模型的图像分类模块 , 可以根据文字描述给图片的匹配程度打分 。
今年年初 , 就有人用CLIP做出了一个用“大白话”检索图片的功能 , 效果还挺惊艳的 。
△输入“Thewordlovewrittenonthewall”的搜索结果
总的来说 , StyleGAN-NADA的训练机制包含两个紧密相连的生成器Gfrozen和Gtrain , 它俩都使用了StyleGAN2的体系结构 , 并共享同一个映射网络 , 因此也具有同一个隐空间(latentspace)和隐码(latentcode) , 所以它们在最开始生成的图像是一样的 。 
文章图片
首先使用在单个源域(例如人脸、狗、教堂或汽车数据集)上预训练的模型权重初始化这两个生成器 。
由于最终目标是生成一个风格不一样的图像 , 那就要更改其中一个成对生成器的域 , 同时保持另一个作为参考域 。
具体的话就是Gfrozen的权重保持不变 , 而Gtrain的权重通过优化和迭代层冻结(iterativelayer-freezing)方案进行修改 。
而Gtrain的域在通过用户提供的文本方向进行更改(shift)的同时 , 会保持共享隐空间(latentspace) 。
具体怎么“更改”呢?
这就用到了一组基于CLIP的损失(loss)和“分层冻结”(layer-freezing)方案 。
该方案可以自适应地确定在每次迭代训练中最相关的子层、并“冻结”其余层来提高训练稳定性保证效果 。 下面就详细介绍一下这两个方法 。
StyleGAN-NADA依靠预先训练的CLIP作目标域的唯一监督来源 。 为了有效地从CLIP中提取“知识” , 一共用了三种损失算法:
(1)负责确定在每次迭代中训练哪个子集层的全局目标损失(GlobalCLIPloss);
(2)旨在保持多样性的局部定向损失(DirectionalCLIPloss);
(3)以及防止图像生成不必要的语义伪影的嵌入范数损失(Embedding-normLoss) 。
此机制分为两阶段:
(1)选层阶段 , 保持所有网络权重不变并对一组隐码进行优化 , 然后选择变化最显著的一层(优化使用目标域文本描述驱动的全局CLIP损失进行);
(2)优化阶段 , “解冻”选定层的权重 , 然后使用定向CLIP损失进行优化和更改 。 
文章图片
大多数训练只需几分钟就可完成
- 位于广东省阳江市的海陵岛自然资源丰富,景色优美,该岛没有 神奇海洋6月28日答案
- 显卡|3个不买RTX 3080的理由:没钱只能排最后
- 高通骁龙|夏天一到骁龙8Gen1没怎么玩就发热?Find X5 Pro用户最有发言权
- 往宇航员的血管里种藻类,科学家这个想法太疯狂,来看结果怎么样
- 和真的几乎一样,这个仿生蜻蜓,要实现《沙丘》里的扑翼机了
- 水洞中发现玛雅人残骸,可能并没有消失,或揭开玛雅消失之谜!
- |大家都说iPhone好看,其实可能对这个品牌更喜欢才对
- CPU|什么叫重新将商品权重补起来?为啥补单没效果?
- 甩掉字幕看韩剧!只需要这个操作就够啦!
- 年轻人不爱换手机?三年没换手机的我 无奈买了红米K50
