东升国际官网

申请试用
登录
  • hd-share-img01
主题技术
以原创技术系统为根基,SenseCore东升国际官网AI大装置为主题基座,布局多领域、多方向前沿钻研,
急剧买通AI在各个垂直场景中的利用,向行业赋能。

入选AAAI 2020,全新视频语义宰割和光流结合进建算法问世

2020-02-07

隔离疫情不隔离进建,读论文也是很好的在家“充电”方式之一。


今日,第34届人为智能顶级会议AAAI 2020正式开幕(2月7日-2月12日在美国纽约进行)。AAAI(Association for the Advance of Artificial Intelligence——美国人为智能协会)是人为智能领域的重要学术组织之一,其年会每年都吸引了大量来自学术界和产业界的钻研员、开发者投稿,参会。


东升国际官网科技钻研团队颁发论文《Every Frame Counts: Joint Learning of Video Segmentation and Optical Flow》,创新性地将视频语义宰割和光流步骤融合,极大提升了视频宰割的正确率和效能,该论文也被AAAI 2020录用。这种步骤在自动驾驶、机械人、人体姿势鉴别、AR特效等诸多场景均有宽泛利用远景。


那么这篇论文到底有哪些创新呢?下面逐一解读。


▎突破现有步骤局限


现有的视频语义宰割步骤,是利用前后帧的语义信息预测活动轨迹来宰割,这种步骤面对两大挑战:


  • 正确率低。视频标注不如图像标注那样每一帧城市标注,一个视频片段往往只标注一帧,现有步骤难以利用全数的数据,导致宰割的正确率较低。

  • 效能低。由于对前后帧之间进行信息交互往往为模型引入额表的?,导致视频宰割效能低。


东升国际官网在钻研中改进了这些不及,提出了一个光流和语义宰割结合进建的框架。

640.jpg

图1:现有步骤和东升国际官网算法比力


现有步骤往往使用Feature aggregation将多帧信息融合到一路,然而这种规划仅仅利用了标注帧左近的少数帧(t, t-1, t+1)并且极大增长了网络的推算功夫。


本文的步骤使用Temporal consistent constraint(时序一致性约束)为多帧的特点之间增长隐式约束,在不增长耗时的前提下利用更无数据进建到更鲁棒的特点。


本文提出的结合进建框架(如图2),输入图片经过共享编码器后分为两个分支,上半部门是光流分支,下半部门是宰割分支,以实时序一致性?(黄色)和遮挡估计?(灰色)。

640 (1).jpg

图2:光流和语义宰割结合进建框架

▎语义宰割和光流相辅相成


本论文的语义宰割和光流是相辅相成的,语义宰割为光流和遮挡估计提供了更丰硕的语义信息,而非遮挡的光流保障了语义宰割的像素级此外时序一致性。


值得一提的是,通过光流施加的约束并没有显式的特点融合,而是隐式约束。在训练网络模型时必要宰割和光流,但现实测试、利用的时辰只必要宰割。


这种步骤可援手利用数据集中的全数数据并学到更鲁棒的宰割特点以提高宰割正确率,并且不会在测试阶段增长额表的推算量。


但是,使用光流步骤也会产生新的问题:遮挡。如下图,行人过马路时把后面的树挡住。那么若何更正确预估遮挡部门布景呢?

640.webp.jpg



本文使用无监督的方式进建遮挡区域,通过反向光流揣摩出可能无法对齐的像素地位O(即遮挡区域),模型凭据此进建得到O_{est};两帧的宰割了局通过光流warp不一致的区域设为O_{seg},O_{seg}应蕴含遮挡区域和光流估计谬误的区域,因而O_{error} = O_{seg}-O_{est}应为光流估计的沉点区域。

在推算光流估计的损失函数时,作者不思考遮挡区域(O_{est})的损失,而加大沉点区域(O_{error})的权沉。


▎多个数据集测试了局排名前列


这种步骤的成效到底若何呢?


作者别离在Cityscapes、CamVid和KITTI数据集上进行了测试,均排名前列。在不使用额表数据集的情况下,均排名第一,具体如下表:

640 (2).jpg

表1:Cityscapes数据集上的宰割了局:本文算法排名第二,排名第一的步骤VPLR天生了额表的数据

640.webp.jpg

表2:CamVid数据集上的宰割了局:本文算法排名第一

640.jpg


表3:KITTI数据集上的光流估计了局:本文算法排名第三,排名第一和第二均使用了额表数据集


再来看下可视化成效对比。


640 (1).jpg


图4:CityScapes验证集图片可视化了局。从上至下别离为原图,本文算法宰割了局,PSPNet宰割了局和GT(尺度了局)


从图4能够看出,本文算法对移动指标(汽车,自行车)和呈显斓次较少指标(横向卡车)宰割成效较好。


以图中第二列的卡车鉴别为例,本文算法能更齐全的鉴别卡车状态,且图中色彩较少(一种色彩代表一种物体),根基能正确鉴别卡车。而PSPNet宰割步骤识此外卡车色彩较多,即鉴别成多种物体,对卡车的鉴别不够正确。


并且,尝试了局的视频中PSPNet宰割步骤对移动的卡车鉴别了局为多种色彩,即鉴别成了多种物体。相比之下,本文算法更不变。



本文的光流估计成效也当先行业。图五是KITTI数据集上光流估计了局,从上至下别离为原图,本文算法估计了局,GeoNet估计了局和GTD芄豢闯霰疚乃惴ǘ砸贫副甑谋咴倒兰聘。


640.webp.jpg

图5:KITTI 数据集光流估计可视化了局


GeoNet估计的尝试了局,在左一列鉴别汽车地位偏离尺度了局,在左二、三列鉴别汽车较吞吐,与尺度了局相差较大。相比之下,本文算法更靠近尺度了局。


论文作者:Mingyu Ding, Zhe Wang, Bolei Zhou, Jianping Shi, Zhiwu Lu, Ping Luo

论文地址:https://arxiv.org/pdf/1911.12739.pdf

640.webp (1).jpg

640.webp (3).jpg


产品试用
填写此单一表格,我们将尽快联系您!
商务合作
400 900 5986
周一至周五 9:00-12:00,13:00-18:00
合作同伴招募
【网站地图】