- 主题技术
- 以原创技术系统为根基,SenseCore东升国际官网AI大装置为主题基座,布局多领域、多方向前沿钻研,
急剧买通AI在各个垂直场景中的利用,向行业赋能。
CVPR 2020 Poster | ACGPN: 基于图像的虚构换装新思路
导读:在CVPR 2020上,东升国际官网科技提出的自适应内容天生保留网络ACGPN值得关注,该工作为基于图像的虚构换装提供了新的思路。并且该工作提出了一种新鲜的衡量虚构换装难度的指标,并将所用数据集划分成了三个难度。相迸宗主流步骤,ACGPN不论是视觉质量上还是量化尝试上都有显著优势。
回首
介绍算法之前,我们先来回首一下基于图像的虚构换装的汗青。传统的虚构换装基于3D匹配,好比一些换装墨镜,都是天生一个跟踪人物的虚构贴图。 而基于图像的虚构换装,能够直接天生换好装的人物图片。 VITON提供了一个被宽泛使用的pipeline,此刻的步骤大多遵循类似的框架。
1.利用网络泛化能力的沉构进建
由于统一个模特在统一姿势下穿戴分歧衣服的数据集较难获得,常见做法是,将人物图片的监督信息减弱,再将与人物身上同样的inshop-clothes(平铺的衣服正面大图)穿在这个处置过后的表白上。将图片的监督信息减弱预防过强的参考使得网络无法泛化到分歧的衣服上。 也就是提取关键点,吞吐状态等来作为一幼我物的表白,再沉构原来的图像。 经典的衣服无关人物表白(clothing-agnostic person representation) 如下图所示。

CP-VTON和VITON都选取了这一表白。但是由于提供的先验信息较少,原图的监督领导已经被压缩到了极幼值,固然能够很好的解决原图原有服装对天生的滋扰,但也难以让网络学会对复杂细节的建模。
2. 基于Thin-Plate Spline (TPS)变换的服装变形?

VITON:如图所示,VITON通过先生裁缝服mask和原始inshop-clothes的mask来推算TPS变换的参数,将这套参数使用到inshop-clothes上,天生一个变形衣服图。之后会和之前天生的一个coarse人物了局,一路refine出最终了局。整个流程是2-stage模式。VITON在进行图像对齐的时辰,利用Shape Context描述子提取图像特点实现对齐,后来的CP-VTON则把这个部门用卷积神经网络包办。

CP-VTON:CP-VTON基于VITON这个工作,增长了一个“GMM?椤,使用一个网络来回归TPS变换的参数,抛弃了之前利用shape context图像descriptor进行匹配的步骤,造成learning-based,奠定了这一?榈耐ǔI杓撇街。
动机

现有步骤存在的问题
我们拿CP-VTON和VITON举例,以上为CP-VTON的文章中汇报的图像了局,我们能够看到以下几点问题:
1.人物的肢体依然较为吞吐。
2.对于下装很难做到明显的保留。
3.衣服的纹理容易产生过度形变。
当我们运行两者的官方源代码,得到下图的了局,我们还能发现一个更为性质的问题。

这两个步骤都无法处置人物肢体与衣服有交叉的情况。一旦手挡在了衣服前,或者姿势较为复杂,往往图片会迷失肢体细节,手指糊成一团。这给面向真实场景利用的虚构换装系统的实现,带来极大的隐患与阻力,终于用户在使用的时辰,姿势是各类各样的。 为相识决这一问题,我们使用语义宰割来包办原有的衣服无关人物表白。
网络设计
该文章提出了一种自适应内容天生保留网络即ACGPN。此步骤利用一种layout aware的步骤,自适应的判断哪部门图像是应该保留的,解决了现有步骤中,无法对人物肢体与衣服有遮挡的情况的建模,极大水平地降低了天生了局中的伪影以及吞吐细节;并通过引入仿射变换的共线性等性质,对变形inshop-clothes中的TPS变换起到约束,使得Logo和斑纹不易扭曲变形。

ACGPN首先预测参考图像的语义布局,而后凭据预测的语义布局自适应地确定内容的天生或保留。出格地,ACGPN由三个重要?樽槌,如图所示。
第一个是语义天生?(Semantic Generation Module (SGM)),它使用身段部位和衣服的语义宰割来逐步天生露出的身段部位的蒙版(即,合成的身段部位蒙版)和变形衣服区域的蒙版。与现有技术相反,提出的SGM以两阶段的方式天生语义蒙版,以首先天生身段部位并逐步合成服装蒙版,这使得参考图像中的原始服装状态对于网络齐全不成知。
第二部门是衣服变形?(Clothes Warping Module (CWM)),该?橛糜谄揪萏焐挠镆宀季侄砸路进行变形操作。除了基于薄板样条的步骤以表,还对变形优化指标引入了二阶差分约束,以使变形过程越发不变,尤其是对于质地复杂的衣服。
最后,内容融合?(Content Fusion Module (CFM))整合了来自合成的人体部位蒙版,变形的服装图像和原始人体部位图像的信息,以自适应地确定合成图像中分歧人体部位的天生或保留。
二阶差分约束
在Clothes Warping Module里面,该文章使用Spatial Transformation Network (STN) 利用薄板样条插值算法(TPS)对指标衣服进行变形,以保留衣服的纹理细节。但是,仅仅使用现有结构不及以保留精确的纹理细节,尤其是面对复杂姿势、复杂衣服斑纹的时辰,更容易出现不匹配的情况。为相识决这一问题,该文章引入一种二阶差分约束,对TPS变换中的网格点进行节造。

从图中我们能够看出没有该文章的约束,衣服固然在整体状态上没有差距,但是内部花腔会产生较大扭曲。约束的公式为:
暗示约束的Loss,
和
是权沉超参数。p(x,y) 暗示一个特定的采样节造格点, p0(x0,y0),p1(x1,y1),p2(x2,y2),p3(x3,y3) 别离暗示p(x,y)周围的高低左右四个点。

暗示两个点之间的斜率。通过这个约束能够引入仿射变换的两个性质,共线性和对应线段比例一样。从而削减过度的扭曲变形的产生。并且为了预防在求取斜率中会出现的除零谬误,使用乘积大局:

形变Loss此处以L2暗示,它是形变后的衣服与其ground-truth之间的1-范数距离
,
是形变后的衣服,
是其ground-truth。
最后的Loss即为:

其中
暗示总的形变Loss。
数据集:VITON Dataset
VITON在Zalando服装网站(www.zalando.de)网络的数据集。它蕴含约莫19,000个图像对,每个图像对都蕴含一个正面的女性图像和一个上衣图像。 删除无效的图像对后,它会产生16,253个配对,并进一步分为训练组14,221对和测试组2,032对。
尝试了局
尝试 尝试都是在VITON数据集上进行,并且凭据姿势的复杂水平能够分为Easy,Medium,Hard三个等级。 Easy: 手放两侧,身段向前; Medium: 身段味产生扭曲,肢体与身段轻微遮挡; Hard: 肢体与身段有严沉遮挡。 该文章一共从两个方面证明所提步骤,质量性尝试:比力虚构换装了局,该文章提出的步骤能够更有效地降低伪影提高真实度,并且能更好的保留衣服的纹理细节,达到照片级此外换装成效;量化指标:通过SSIM和IS以及用户调查等指标,从另表一个方面证明ACGPN算法的优越性。

传送门
ACGPN代码目前已经开源,欢迎各位同学使用和互换。
论文地址:https://arxiv.org/abs/2003.05863
源码地址:https://github.com/switchablenorms/DeepFashion_Try_On
References
[1] Bochao Wang, Huabin Zheng, Xiaodan Liang, Yimin Chen, Liang Lin, and Meng Yang. Toward characteristic preserving image-based virtual try-on network. In ECCV(13), volume 11217 of Lecture Notes in Computer Science, pages 607–623. Springer, 2018.
[2] Xintong Han, Zuxuan Wu, Zhe Wu, Ruichi Yu, and Larry S. Davis. VITON: an image-based virtual try-on network. In CVPR, pages 7543–7552. IEEE Computer Society, 2018.
[3] Ruiyun Yu, Xiaoqi Wang, and Xiaohui Xie. Vtnfp: An image-based virtual try-on network with body and clothing feature preservation. In The IEEE International Conferenceon Computer Vision (ICCV), October 2019.





返回