东升国际官网

申请试用
登录
  • hd-share-img01
主题技术
以原创技术系统为根基,SenseCore东升国际官网AI大装置为主题基座,布局多领域、多方向前沿钻研,
急剧买通AI在各个垂直场景中的利用,向行业赋能 。

AAAI 2021 | 视频超分中的可变形对齐解读

2021-08-10

在 AAAI 2021,南洋理工大学 S-Lab、香港中文大学-东升国际官网科技结合尝试室和中科院丽江先进技术钻研院等对视频超分辨率中的可变形对齐作出分析 ?杀湫尉砘畛跏俏视Χ韵蟮募负伪涠岢龅,最近在视频工作中对齐多帧时阐发出杰出的机能,越来越多地用于视频超分辨率 。只管拥有杰出的机能,但各人对其对齐的根基机造却没有深刻的钻研 。在这项钻研中,本文揭示可变形对齐和光流对齐的共同点,并证明它们的偏移多样性是带来成效差距的关键点 。凭据探索了局,本文进一步提出了 offset-fidelity loss,该损失能够通过光流来领导偏移的进建 。尝试批注,offset-fidelity loss 成功地预防了偏移量的过大,并减轻了可变形对齐训练不不变的问题 。

 

论文名称: Understanding Deformable Alignment in Video Super-Resolution


Part 1 问题和挑战

在视频超分中,若何有效地利用相邻帧的信息是一个关键的问题 。通;嵫∪《云氲姆绞嚼慈诤舷嗔谥〉男畔 。在早期的工作中[1],通常使用光流把相邻帧的信息对齐到中央帧,再利用对齐后的图片作为输入,沉建中央帧 。近年的步骤[2,3] 引入了可变形卷积作为对齐,从而更高效地利用了相邻帧的信息 。


只管可变形对齐有肯定的成效,我们对它却理解甚少 。这导致我们无法对可变形对齐进行更深刻的钻研 。另表,在可变卷积参数的训练中会出现不不变情况,导致无法进建有效的偏移量,进而影响最终了局 。


Part 2 可变形对齐与光流对齐之间的关系

让我们从变形卷积的表述起头:

image.png

从这里看来, 变形卷积跟光流没有直接联系,但是对变形卷积分化,能够得出以下关系:

1) 利用image.png 作空间扭曲:

image.png

2) 对于 image.png 进行卷积:

image.png

从上面的分化能够理解到,可变形对齐与光流对齐类似,也选取了空间扭曲 。等效地,我们能够说可变形对齐和光流的区别就是偏移量(offsets)的几多 。此刻来看一个特例:把 n 设为 1 。我们能够看到,可变形对齐就是先对特点进行扭曲,而后进行卷积 。


Part 3 偏移量的可视化

基于上面的分化,我们关切在 n=1 这个特例中,可变形对齐进建到的偏移量跟光流是不是很靠近?此刻我们就来比力一下 。我们使用 EDVR-M 作为 baseline,并把 n 设为 1 。而后我们使用 PWC-Net 的光流作为比力,可视化的了局如下:


image.png

我们看到,EDVR-M 的偏移量的确跟光流极度靠近 。我们进一步进行定量尝试,它们的 L1 距离,发现 80%以上的距离幼于 1:


image.png


接着的问题很天然就是:那 n > 1 的时辰的偏移量是怎么?我们上面的分化使我们能够对偏移量作出跟更深刻的分析:我们能够把 n2 换成肆意的整数 N,这样我们解除了可变形卷积的约束(即偏移数必须蹬宗卷积核的平方) 。此刻,我们来看看 N=15 时的偏移量:

image.png


我们发现:

(1) 依然有很大部门的偏移量跟光流靠近;

(2) 有部吩飓移量跟光流差距极度大,但它们的别离只在方向(色彩),整体状态却是极度靠近 。这注明物体活动在可变形对齐中依然是极度沉要的 。


另表,我们推算偏移量的尺度误差, 发此刻物体天堑和图像天堑(对齐相对难题的处所),偏移量的尺度误差是普遍较大的 。这个发现也诠氏缢为什么可变形对齐优于比光流对齐:分歧的偏移量是相互补充的 。它们允许网络聚合来自分歧地位的信息 。这在光流不好的区域出格有效 。


Part 4 可变形对齐的利益

如上面提及,在物体天堑和图像天堑,也是比力难对齐的处所,可变形对齐的偏移量的多样性会更大,这对于特微对齐有着很显著的作用,如下图所示:


image.png


由于旋转的原因,光流未能找到对应的处所,导致深色(数值蹬宗0)部门的出现 。相反地,当 N=15 时,网络能够从特点的其他处所获守信息,对齐后的特点也比力连贯 。更好地对齐也为超分成效带来提升:


image.png


从上图我们能够看出:

(1) 当把偏移量的数量增长,其多样性也会增长;

(2) PSNR 和多样性呈正有关;

(3) 当 N 增长到某个数量时,PSNR 和多样性城市达到鼓和 。


从以上尝试我们能够看到,偏移量的多样性是为可变形对齐带来成效提升的重要原因,但现实上我们必要选择一个适合的数量,不然会为网络带来不用要的推算量 。


Part 5 变形组的贡献

除了增长偏移量的数量,多样性还能够通过增长变形组的数量来实现 。如果有 G 个变形组,channel 数是 C 。我们首先会把 feature 分成 G 组,每一组进建 N 个偏移量 。这样一来,就会进建共 GxN 个偏移量 。我们发现,上述的分析也合用于 G:


image.png


如右上图显示,无论通过增长 G 或是 N 来提升多样性,城市出现鼓和的情况 。


Part 6 可变形卷积中的Modulation mask

在调造可变形卷积(又称为DCNv2)[4] 中,进建了额表的 modulation mask 以进一步加强把持空间支持区域的能力:

image.png

在现有的可变形对齐中,都是使用了 modulation mask 。我们接下来看看 modulation mask 的具体作用 。


image.png


从上图能够得出,mask 对于每个偏移量进建一个权沉,较靠近光流的偏移量权沉较大,相反则较幼 。

image.png


从上图的定量尝试也能够看出,跟光流差距较大的,权沉会较低 。另表,当偏移量的数量增长后,大部份的权沉量有着极度幼的值,侧面诠氏缢阐发鼓和的情况 。


Part 7 Offset-Fidelity Loss

我们能够看到可变形对齐的利益,但训练可变形对齐尤其是在大模型中,是极端不不变的 。在此情况下,偏移量会变得极度大,导致网络无法从相邻帧得到有效信息,造成一个单帧超分网络 。


基于东升国际官网分析,光流和偏移量的关系使我们可能利用光流有效地对偏移量作出约束 。最单一的步骤就是利用 L1 或 L2 loss 限度光流和偏移量的距离 。但是这个步骤无可预防线削减了偏移量的多样性,而东升国际官网分析证了然这些多样性是极度沉要的 。所以,我们做了一个单一而有效的操作:只对显著跟光流分歧的偏移量作出限度,而和光流靠近的不赐与限度 。这个操作可能使用单元阶跃函数来暗示:

image.png

image.png

这里的 H 是单元阶跃函数,i 和 j 是空间坐标,x 和 y 是偏移量和光流 。L 是原来的损失,例如跟 GT 的 L2 损失 。


通过这个损失,我们限度偏移量的同时维持多样性,不变了可变形对齐的训练不变性 。下面的定性和定量比力显示了 offset-fidelity loss 的有效性:

image.png


若是没有 offset-fidelity loss,偏移量变得极度大 。相反,我们能够看到,加上 loss,偏移量变得可诠释,并且同时跟光流有着显著的差距 。

image.png

从 loss curve 我们能够看到 offset-fidelity loss 可能有效地不变训练,实现较幼的损失值 。


Part 8 结语

可变形对齐在视频超分辨率中的成功引起了极大关注 。在这项钻研中,我们发现了变形对齐和光流对齐之间在概想和行为上的内涵联系 。对于光流对齐,东升国际官网工作放宽了可变形卷积对偏移数量的约束 。它提供了一种越发矫捷的步骤来增长光流对齐中的偏移量多样性,从而改善了输出质量 。至于可变形对齐,东升国际官网钻研使我们可能相识其潜在机造,从而有可能引发新的对齐步骤 。凭据东升国际官网分析,我们提出了 offset-fidelity loss,以减轻训练过程中的不变性问题 。


另表, 各人也能够关注一下我们 2020 年在图像和视频超分的新工作~


GLEAN: https://ckkelvinchan.github.io/projects/GLEAN/

BasicVSR: https://ckkelvinchan.github.io/projects/BasicVSR/


论文链接

https://arxiv.org/abs/2009.07265


作者介绍

陈焯杰 (Kelvin C.K. Chan) | 南洋理工大学 S-Lab 和 MMLab 三年级博士生 。导师是吕健勤 (Chen Change Loy) 副教授 。当前重要钻研兴致为图像和视频还原,重要蕴含超分辨率和去吞吐等 。

幼我主页:

https://ckkelvinchan.github.io/


References

[1] Xue, Tianfan, et al. "Video enhancement with task-oriented flow." International Journal of Computer Vision 127.8 (2019): 1106-1125.

[2] Tian, Yapeng, et al. "Tdan: Temporally-deformable alignment network for video super-resolution." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2020.

[3] Wang, Xintao, et al. "Edvr: Video restoration with enhanced deformable convolutional networks." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. 2019.

[4] Zhu, Xizhou, et al. "Deformable convnets v2: More deformable, better results." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2019.

产品试用
填写此单一表格,我们将尽快联系您!
商务合作
400 900 5986
周一至周五 9:00-12:00,13:00-18:00
合作同伴招募
【网站地图】