【论文阅读】残差注意力网络Residual Attention Network

注意力

注意力一般分为两种:一种是自上而下(top-down)的有意识的注意力,称为聚焦式(focus)注意力。聚焦式注意力是指有预定目的、依赖任务的、主动有意识地聚焦于某一对象的注意力;另一种是自下而上(bottom-up)的无意识的注意力,称为基于显著性(saliency-based)的注意力。基于显著性的注意力是由外界刺激驱动的注意,不需要主动干预,也和任务无关。如果一个对象的刺激信息不同于其周围信息,一种无意识的“赢者通吃”(winner-take-all)或者门控(gating)机制就可以把注意力转向这个对象。不管这些注意力是有意还是无意,大部分的人脑活动都需要依赖注意力,比如记忆信息,阅读或思考等。 一个和注意力有关的例子是鸡尾酒会效应。当一个人在吵闹的鸡尾酒会上和朋友聊天时,尽管周围噪音干扰很多,他还是可以听到朋友的谈话内容,而忽略其他人的声音(聚焦式注意力)。同时,如果未注意到的背景声中有重要的词(比如他的名字),他会马上注意到(显著性注意力)。

残差注意力网络

注意力残差学习

软掩膜分支

空间注意力和通道注意力

网络结构图

实验测试

在CIAFR上测试

注意力残差学习这样测试

对比不同的掩膜结构

噪声标签鲁棒性

实验发现,在CIFAR-10数据集上,残差注意力网络在论文《Training convolutional networks with noisy labels》的设置下具有抗噪性。实验中的混淆矩阵Q设置如下: Q = ( r 1 − r 9 ⋯ 1 − r 9 1 − r 9 r ⋯ 1 − r 9 ⋮ ⋮ ⋱ ⋮ 1 − r 9 1 − r 9 ⋯ r ) 10 × 10 Q=left( egin{array}{cccc}{r} & {frac{1-r}{9}} & {cdots} & {frac{1-r}{9}} \ {frac{1-r}{9}} & {r} & {cdots} & {frac{1-r}{9}} \ {vdots} & {vdots} & {ddots} & {vdots} \ {frac{1-r}{9}} & {frac{1-r}{9}} & {cdots} & {r}end{array} ight)_{10 imes 10} Q=⎝⎜⎜⎜⎛r91−r⋮91−r91−rr⋮91−r⋯⋯⋱⋯91−r91−r⋮r⎠⎟⎟⎟⎞10×10 其中r表示整个数据集的正确标签比率。 将ResNet-164网络与Attention-92网络在不同的噪声水平下进行比较,结果如下表。相同噪声水平下,Attention-92网络的测试误差明显低于ResNet-164网络。此外,当提高噪声比时,与ResNet-164网络相比,Attenion-92的测试误差缓慢下降。这些结果表明,残差注意力网络可以很好地使用高比率的噪声数据进行训练。当标签有噪声时,相应的掩膜可以防止由标签错误引起的梯度更新主干分支参数。

与state-of-the-art方法对比

将残差注意力网络与state-of-the-art方法进行比较,包括CIFAR-10和CIFAR-100数据集上的ResNet和Wide ResNet,结果如下。Attention-452优于CIFAR-10和CIFAR-100数据集上的所有baseline方法。在相同参数下,Attention-92在CIFAR-10上的测试误差为4.99%,在CIFAR-100上的测试误差为21.71%,而ResNet-164在CIFAR-10和CIFAR-100上的测试误差分别为5.46%和24.33%。此外,Attention-236仅使用一半参数就优于ResNet-1001。结果表明,注意力模块和注意力残差学习方案可以有效地减少网络中的参数量,同时提高分类性能。

在ImageNet上测试

掩膜的作用

在ImageNet上比较Attention-56和ResNet-152,结果如下表。Attention-56网络大幅优于ResNet-152,top-1 error减少了0.4%,top-5 error减少了0.26%。更重要的是,与ResNet-152相比,Attention-56网络仅仅52%的参数和56%的FLOPs就达到了更好的性能,这表明所提出的注意机制可以显着提高网络性能,同时降低模型复杂性。

使用不同的基本单元

与state-of-the-art方法对比

经验分享 程序员 微信小程序 职场和发展