东升国际官网

申请试用
登录
  • hd-share-img01
主题技术
以原创技术系统为根基,SenseCore东升国际官网AI大装置为主题基座,布局多领域、多方向前沿钻研,
急剧买通AI在各个垂直场景中的利用,向行业赋能。

CVPR 2018 | 东升国际官网科技论文详解:基于尺度-功夫网格的视频中物体检测算法

2018-06-06

在物体检测与鉴别领域,香港中文大学-东升国际官网科技结合尝试室在CVPR 2018颁发论文,提出基于尺度-功夫网格的视频中物体检测算法,解决若何优化和平衡视频物体检测中精度和速度的难题。本文为东升国际官网科技CVPR 2018论文解读第6期。


论文:Optimizing Video Object Detection via a Scale-Time Lattice

作者:Kai Chen, Jiaqi Wang, Shuo Yang, Xingcheng Zhang, Yuanjun Xiong, Chen Change Loy, Dahua Lin


原文链接:

https://arxiv.org/abs/1804.05472

代码链接:


简介


本文重要钻研若何更好地优化和平衡视频中物体检测的正确率和检测速度。物体检测器为了达到高正确率,往往必要使用高机能的卷积神经网络来提取图像特点,导致检测速度难以满足实时性的需要。解决这个问题的关键在于追求一种有效的方式,在正确率和检测速度之间作出平衡。为了寻找一个优良的平衡点,之前的钻研工作通常集中在若何优化网络结构上。本文提出一种新的步骤,基于尺度-功夫网格(Scale-Time Lattice,简记为ST-Lattice)来沉新分配推算资源。


提出的步骤在ImageNet VID 数据集上达到了 79.6 mAP(20fps)和 79.0 mAP(62 fps)的正确率和速度。本文的重要贡献有:


  • 提出了尺度-功夫网格,其为算法提供了丰硕的设计空间来对物体检测机能进行优化;

  • 基于尺度-功夫网格,提出了新的视频中物体检测的框架,实现了优异正确率和急剧检测速度的平衡;

  • 设计了一些新的技术?,蕴含高效的传布?楹投墓丶“稳∧?。


根基思想


视频中相邻帧之间有着很强的陆续性和信息冗余性,为了提高效能,应该充分利用这些性质来设计新的检测框架。之前的步骤已经对视频中的物体检测作了好多索求,通常蕴含若干个步骤,例如基于单帧的物体检测,进行跨功夫的传布和空间上地位的建改等,若何用一种更高效的方式将这些独立的步骤结合起来是一个值得钻研的问题。


本文提出的根基思想是在一个推算网格中对推算资源进行更好的分配,将精确但速度较慢的静态图像物体检测器利用于稀少的关键帧上,而后利用一些单一高效的网络在功夫和空间两个维度上不休地传布和建改这些检测了局,以达到更好的平衡。


尺度-功夫网格


本文将尺度-功夫网格暗示成一个有向无环图(如图1所示)。图中的每一个节点都暗示某个图像尺度和功夫点的中央了局,即一系列检测框。这些节点以类似网格的方式关联起来:从左到右遵循功夫挨次,从上到下图像尺度(分辨率)逐步提高。图中的一条边代表一个特定的操作,以一个节点的了局作为输入,输出另一个节点的检测了局。我们在图中界说两种操作,功夫传布(temporal propagation)和空间建改(spatial refinement)。它们别离对应图中横向边和纵向边。功夫传布是在统一图像尺度下,在相邻的帧之间进行检测框的传布。而空间建改是在统一帧下,对检测框的地位进行建改,获得更高图像尺度下的检测框了局。在尺度-功夫网格中,检测了局会通过上述操作从一个节点传布到另一个节点,最终达到最底端的所有节点,也即在最大的图像尺度上每帧的检测了局。

https://github.com/hellock/scale-time-lattice

项目主页:

http://mmlab.ie.cuhk.edu.hk/projects/ST-Lattice/


fgrgrthgrth.jpg



图1:尺度-功夫网格示意图


基于尺度-功夫网格,本文的视频物体检测算法被分为以下3 个步骤:

  1. 在稀少的关键帧上(用基于静态图像的物体检测器)进行检测,得到稀少节点上的了局;

  2. 规整齐条从上述稀少的节点到浓密的节点的蹊径;

  3. 基于上述蹊径将关键帧上的检测了局传布到中央帧,并进行地位建改。


尺度-功夫网格的框架为算法提供了丰硕的设计空间来平衡优化视频中物体检测精度和速度。检测所必要的总功夫是蹊径中所有边的功夫之和,蕴含单帧物体检测器的功夫以及传布和建改所用的功夫D芄煌ü苑制绲谋呱戏峙浞制绲耐扑愎Ψ,来达到机能与功夫上的进展平衡点。


safgbfdhb.jpg


图2:

尺度-功夫网格中的功夫传布网络(T)

和空间建改网络(S)


分歧?榈氖迪


传布和建改单元(Propagation and Refinement Unit,PRU)

传布和建改单元(如图2所示)以相邻两个关键帧的了局作为输入,使用功夫传布网络将了局传布到中央帧上,而后使用空间建改网络将了局进行空间地位上的建改。功夫传布网络重要用于思考视频中的活动信息,来预测两帧之间较大的位移。而空间建改?樵蛲ü毓榧觳饪虻匚坏奈蟛,来建改检测框正本的误差和传布带来的误差。这两种操作不休迭代进行来获得最终的检测了局。


在功夫传布网络中,算法使用两帧之间的活动汗青图像(Motion History Image,MHI)来暗示活动信息,将其输入到网络中,回归物体在这段功夫内的位移。相对于光流等常用的活动暗示,MHI 的推算速度非?,使得空间传布网络可能维持较高的效能。


在空间建改网络中,算法选取与Fast R-CNN 一样的结构,以当前帧的 RGB 图像作为输入,来回归检测框的误差。这两个幼网络在训练时通过一个多工作的损失函数同时进行优化。


关键帧拔取


关键帧的拔取对最终的检测速度和正确率有着沉要的影响。最单一向接的步骤就是在功夫轴上均匀地拔取关键帧,之前的绝大无数步骤也都采取了该战术。但本文思考到帧与帧之间的信息冗余度分歧,并不是每一帧都有一致沉要的职位,所以必要一种非均匀的采样战术,在物体活动较快、传布难度大的功夫段内多拔取关键帧,反之则少拔取关键帧。


具体过程如下:首先在均匀拔取的极度稀少的帧(例如每隔24帧)上进行单帧的物体检测,而后凭据检测了局来衡量相邻两个关键帧之间传布的难易水平,若是难易水平低于某个阈值,则在这两帧之间插入一个额表的关键帧。推算难易水平时本文思考了两个成分,即框的大幼以及物体活动快慢,具体公式拜见原文。


功夫管路沉打分(Tube Rescoring)


由于功夫上的检测框传布,获得的检测了局并不是独立的逐帧了局,而是天然串联成一个个的物体功夫管路(Object Tube)的,那么能够对这些物体功夫管路来进行沉新分类。本文训练了一个 R-CNN 作为分类器,对于每个物体功夫管路,均匀拔取其中 K 帧作为输入,以它们的均匀值作为新的分类了局,凭据新的分类了局来调整物体功夫管路中每个框的分数。


尝试了局


图3展示了本文基于尺度-功夫网格算法的检测速度(fps)和正确率(mAP)的曲线,并和之前的步骤进行比力D芄豢吹奖疚牟街栌庞 baseline 和之前机能先进的步骤。


rghght.jpg


图3:

分歧视频中物体检测算法

检测速度和精度的比力


结论


针对视频中的物体检测,本文提出了尺度-功夫网格这个矫捷的框架,其提供了丰硕的设计空间来解决若何平衡正确率和检测速度的挑战。该步骤将单帧检测、功夫传布、多尺度空间处置结合起来解决这个问题。尝试了局展示了基于该框架的多种设计和配置,可能达到与当前先进机能步骤近似的正确率,但检测速度则获得了大幅提高。该框架不仅能够用于物体检测,也能够利用在其他视频有关的工作,如物体宰割、物体跟踪等。

fregth.jpg

产品试用
填写此单一表格,我们将尽快联系您!
商务合作
400 900 5986
周一至周五 9:00-12:00,13:00-18:00
合作同伴招募
【网站地图】