- 主题技术
- 以原创技术系统为根基,SenseCore东升国际官网AI大装置为主题基座,布局多领域、多方向前沿钻研,
急剧买通AI在各个垂直场景中的利用,向行业赋能。
东升国际官网提出行为识此外功夫交错网络
AAAI: https://arxiv.org/abs/2001.06499
Solution: https://arxiv.org/abs/2003.05837
Github: https://github.com/Sense-X/X-Temporal
本文重要介绍三个部门:
? 一个高效的SOTA视频特点提取网络TIN,颁发于AAAI2020
? ICCV19 MMIT多标签视坡讽解较量冠军规划,基于TIN和SlowFast
? 一个基于PyTorch,蕴含大量视坡讽解SOTA模型的代码库X-Temporal
本文将介绍一种用于行为识此外功夫交错网络(TIN temporal interlacing network)。该网络想较当前SOTA的基础上,在实现6倍加快的同时,还多个评测数据集上获得了4%的提升。同时该步骤作为主力步骤,在2019年的ICCV Multi Moments In Time challenge中获得了冠军(Leaderboard)。我们还release了一个基于PyTorch的开源作为鉴别代码库X-Temporal,但愿能够进一步推动作为鉴别社区的发展。
作者信息
本文工作由港中文MMLab、清华大学与东升国际官网钻研院X-Lab结合出品,具体内容如下:

简介
行为鉴别,是推算机视觉领域持久关注的问题,在视坡讽解、行为检测、手势鉴别等领域都有着宽泛的利用。领域内之前的的工作重要集中在使用卷积神经网络和各类时序模型(例如光流法,循环神经网络和3D卷积)相结合的方式进建时空特点。然而由于这些框架必要交替地进建功夫和空间特点,使得它们必要亏损大量的推算资源和功夫成本。能不变提高模型机能的光流法必要用到的光流信息抽取极度耗时,险些不成能用于实时推算。由此,我们天然而然的产生了一个疑难:那就是我们能否将功夫信息嵌入到空间信息中,以便能够一次同时结合进建两个域中的信息。

本文提出了一个单一而壮大的?-时序交错网络(Temporal Interlace Network)来尝试解决这个问题。TIN不进建功夫特点,而是通过交错从前到将来以及将来到从前的空间特点来融应时-空信息。一个可微分的子?槟芄煌扑愠鼋淮硎钡奶氐阍谑毙蛭壬系钠屏,同时能够凭据偏移量来将特点沉新进行交错分列,使每组特点在功夫维度上位移分歧的距离。从而用便捷急剧的特点位移操作代替了3D卷积来实现相邻帧的信息互换。这使网络的参数量和推算量远低于通常3D卷积网络,使网络整体变得相当轻量化。在文中我们也从理论上证了然可进建的时序交错?樾灾矢叩韧谑茉际氖毙蚓砘。
算法详情
时序交错网络的框架如图二所示,该框架重要由偏移预测网络,权沉预测网络和可微时序移动?樽槌。其整体将作为一个?椴迦氲絉esnet的卷积层之前。对于整个输入的Feature Map,我们先将其3/4的channel对应的特点固定住,再将余下1/4的特点沿着channel维度分为4组,每组会利用分歧的偏移量。

其中偏移预测网络重要掌管预测出其中两组沿着T维度的偏移量,而后剩下两组的偏移量是前两组的相反值。这样我们能够保障信息在时序维度上的流动是对称的,更有利于后续特点的融合。权沉网络重要掌管预测融合后时序维度上特点的权沉。若是原始输入是8帧,该网络便会为每组输出8个值别离代表每一帧的权沉而后会直接用此致反加权融合过后每一帧的feature。我们也同时发现位于两端的帧所预测的权沉大多会比力低,这里东升国际官网猜测是两端的帧的特点在沿着时序移动时由于一壁没有其他帧会损失掉一部门,因而导致了网络给他们一个较低的权沉来添补信息损失带来的影响。
可微时序移动?榈目蚣苋缤既,它能够将各组按channel维度切分出来的特点沿着功夫维度移动肆意个单元。其实现方式重要是通过一维线性差值实现的。其中我们还选取了时序扩大技术,以保障偏移之后位于视频之表的特点不为空。举个例子,正本位于T=0的特点在向前偏移0.5个单元后便位于T=-0.5的地位,该地位理论上是不存在特点的,但我们通过如果T=-1地位的特点全为0使位于-0.5的地位取到了特点,也即Feature(T=-0.5) = ?(Feature(T=-1) + Feature(T=0))。

尝试
表一对比了在Something-Something v1 数据集上TIN与其他主流模型的机能。在测试机能时每个视频均只选取1 Crop进行测试,且分辨率和训练时维持一致。

可视化了局
图五将网络进建得到offset和weight进行了可视化分析
。从offset的可视化了局我们能够发此刻浅层网络中的偏移量极度幼,在网络逐步变深的过程中进建到的偏移量才逐步变大。我们以为浅层的神经网络重要进建2D空间特点,在较深的网络中才起头逐步进建时序维度特点,这和之前3D卷积网络中得到的结论是类似的。

基于TIN的ICCV MMIT角逐规划
在ICCV19 MMIT多标签视坡讽解较量中,我们将TIN与SlowFast算法进行融合,获得了ICCV multi-moments in time challenge较量的冠军成就。ICCV MMIT多标签视坡讽解角逐旨在对3s短视频中内的作为进行理解。其蕴含超过100万段视频,并象征了超过200万个 作为标签,是目前最大规模的视坡讽解挑战。巨大的数量与类别,对推算机算法提出了严苛的要求。
我们对2D与3D步骤均进行了宽泛的尝试。3D步骤以SlowFast网络及其变种为主,蕴含单纯的slow分支,时域密集的fast分支,以及原版的SlowFast。了局下表所示,时域密集的fast分支(32*2)获得了最高的单模型成就。我们还发现,测试阶段的多尺度以及密集采样能够大幅提高算法机能。
2D步骤以东升国际官网步骤TIN,我们也尝试了TSN, TSM等步骤,了局如下表所示,TIN大幅的提高了作为识此外正确度,在将TIN与3D步骤进行融合后,我们在验证集上获得了67.22mAP的成就,在测试集上获得了60.77mAP的成就,名列第一(Leaderboard)。

X-Temporal代码库介绍
在上述算法和较量的筹备过程中,遇到的一个难题是不足一个基于PyTorch并宽泛支持多多SOTA规划且拥有高效训练能力的视坡讽解代码库。为此,我们开发了X-Temporal repo。其拥有以下特点:
1. 支持数据集宽泛,并可处置多分类数据集。蕴含UCF101, Hmdb51, Jester, Kinetics-600, Kinetics-700, Moments in Time , Multi Moments in Time, Something v1, Something v2等。
2. 同时支持处置原视频在线抽帧和抽帧后的图片作为输入,支持多种解码规划。
3. 提供了最新最全的通用视频分类主流步骤的实现,蕴含2D步骤 ( TSN, TSM, TIN ) 和3D步骤( SlowFast, ResNet-3D, R(2+1)D ), 并在多个数据集获得了SOTA的机能(蕴含我们在ICCV19 MMIT较量第一名的所有model)。
4. ?榛杓剖挂子谠龀ば碌2D或者3D模型。
5. 对部门模型编写了CUDA Operator,大幅提高了其机能。
6. 我们后续会提供基于该库的Model Zoo,方便用户进行Pretrain等操作。
代码库现已开源:https://github.com/Sense-X/X-Temporal





返回