$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
实现方式是主模型ResNet-152,同时使用编码器作为CNN,解码器作为RNN,以及材料 表中的资源。
ResNet-152
ResNet被认为是图像字幕中更高效提取特征的骨干。ResNet 在训练表现上优于其他模型,因为它解决了梯度消失问题并高效解决了该问题。图像中可能出现各种物体,模型需要理解它们之间的关系以更好地说明文字。这就是为什么它可以被视为一种层级特征提取。ResNet-152 可以处理复杂的计算机视觉任务。该模型的主要优势是有效利用残差或跳接连接。它在解决梯度消失问题方面非常有效。它可以学习复杂且稳健的特征,以实现更高的准确性。ResNet-152采用瓶颈设计,降低计算成本,使其比VGG-16等其他架构更有效。它拥有显著的迁移学习骨干,适用于预训练模型以及对象检测和数据分割等多样化任务。跳过连接加速了训练,也让它更稳定。与基于变换器的模型相比,后者通过自注意力机制理解顺序数据,ResNet 有很大不同。基于变换器的模型需要大量数据才能深入理解文本数据,因此能产生有效结果,但运行速度稍慢。选择ResNet的动机在于其跳跃连接,这不仅加快了执行速度,结果也显著提升。在图像标题领域,ResNet用于提取表示图像中物体及动作的特征。ResNet 使用了一个利用跳过连接的残留网络。这里,剩余块可以以输入Z为参考计算为:
(5)
其中Z被视为残差块的输入。
是一个残差函数,涉及批次归一化、卷积层和ReLu激活。{xi} 被视为对应层的学习权重。Z 还定义了跳跃连接恒等式,这也解决了梯度消失的问题。ResNet 通常用作图像中可视化特征映射的特征提取器。这里, I 被视为将特征映射表示为高视觉特征表示V的输入图像。
(6)
在提取特征之前,必须对图像进行预处理以提升特征提取效果。它被视为从 MSCOCO 基准测试收集的原始图像,因此预处理的第一步是调整大小并进行归一化。
(7)
(8)
其中Hl是图像的高度,Wl是图像的权重。“我调整大小”是调整尺寸后的图片。
将像素值从范围 [-1, 1] 或 [0, 1] 归一化
(9)
其中 μ 被视为像素的平均值 σ 视为参考图像的标准差。归一化后的图像现在会进一步处理以进行特征提取。
(10)
其中
被视为特征向量。当行标题被标记化后,它会转换为数字格式。
(11)
如果说明文字分成单词,那么
(12)
在这里,词汇起着重要作用,每个单词都通过整数索引唯一标识。
(13)
其中 Vc 被视为一个词汇函数;必须确保所有序列长度均为偶数;因此,最大高度或理想长度被视为 L的最大值。
(14)
现在代币嵌入为:
(15)
当 j = 1,2,3,... .., L最大值时
其中
被视为一个 K 维的嵌入向量;现在解码器用于解码基于概率模型的候选标题生成。
(16)
其中wj是时间戳j的作品,w1:j-1是时间戳j-1生成的词,ej-1是嵌入前一个词wj-1的特征。在每个时间戳处,网络都会根据词汇计算下一个即将出现的单词或概率。
(17)
其中w输出为输出权重,b为输出偏置。因此,最大概率计算为
(18)
候选标题的最大长度是在收到<结尾>词或识别为特殊令牌(如和时计算出。束搜索也有助于选择更合适的候选说明,因此序列为:
(19)
(20)
因此生成的候选说明是 
长短期记忆通常用于序列生成。LSTM使用卷积神经网络作为特征提取器,按顺序生成单词以生成有意义的句子。LSTM在每个时间戳T处计算遗忘门。

其中 ft 被视为遗忘门,σ 作为激活函数, wf 作为权重, bf 作为偏置,
yt 被视为输入特征向量,ht-1 被视为隐藏状态。
(22)
(23)
Jt 被视为输入,
被视为候选状态, wj 和w c 分别被视为输入权重和候选状态, bj 和b c 被视为偏置。
(24)
Ct被视为所有状态,Ct-1被视为前状态。
(25)
Ot 被视为输出, wo 作为重量, bo 作为偏置。为了初始化隐藏态和单元态,需要进行以下计算。
(26)
(27)
其中 hi 和 Ci 分别被视为隐藏态和单元态,wh 和 w c 分别是隐藏状态和帆单元态的权重,bc 和 bh 被视为偏置,k 是特征提取器。说明的顺序计算为:
(28)
其中 T 是生成字幕的长度。
254 × 254 × 3 是调整大小或预处理图像,I 被视为输入图像。
(29)
其中 W 和 b 分别被视为权重和偏置,I 作为输入特征,ReLU 是激活函数。它是卷积层的计算。现在,池化层可以计算为:
(30)
在最终确定积聚层后;全连通层可以映射为:
(31)
其中 wf 和 bf 分别被视为网络的权重和偏置。
(32)
(33)
其中N被视为空间区域,d为特征的维度。
(34)
(35)
其中wh 和bh分别被视为隐藏态的权重和偏置,w、c 和bc 分别视为细胞态的权重和偏置。说明文字可以生成为:
(36)
编码器和解码器
该系统通过卷积神经网络编码数据供机器翻译。在这种情况下,输入和输出都是序列,但它们的长度可能不同。机器一次编码和解码每个向量。以向量为起点,机器开始编码和解码,并持续计算直到最终条件概率分布。一个例子如下:
(37)
这被称为概率分布。
系统可以将数据编码为矢量图像,之后可以进行解码。fcn (I)被视为图像理解的图像模型。
(38)
(39)
(40)
S1 是 S0 的后续迭代,S2 是 S1 的后续迭代。可以说,每个输入都依赖于上一层的输出。图像由CNN转换为矢量,并发送到下一层,该层遍历所有矢量。在这里,RNN将向量解码成单词后,使用注意力机制依次排列单词组成有意义的句子。
(41)
其中 T 是输入的长度。
(42)
(43)
K1、K2、K3、K4、......、K T-1 是隐藏的解码态。

图2:编码与解码模型。 本图展示了用于图像标题的编码-解码框架,展示了图像特征如何被编码为矢量表示,随后再解码为连续的文本描述。 请点击此处查看该图的放大版本。
流程模型
见 图3, 显示训练模块流程图,数据集及其真实说明是先加载的。数据经过CNN编码规范后,ResNet模型被初始化并使用提取的特征进行训练。RNN和带有起始和结尾标记的系统专用词便可用于解码字幕。如果找到最终单词,系统完成提取,N 是候选标题中的总单词数。

图3:训练模型流程图。 图中概述了训练模型的逐步过程,包括数据预处理、特征提取、模型学习和优化。 请点击此处查看该图的放大版本。
测试模型的流程图如 图4所示,系统首先加载编码器和解码器模型,然后加载ResNet模型和输入数据进行字幕提取。如果没有解码错误,可以从第一个字推断到最后一个字。在达到最终单词后,可以获得解码后的单词,并通过使用注意力机制依次排列单词,从而创建有意义的文字说明。训练模型的光束大小为5,最大长度为20,批次长度为128,包含20个历期。

图4:测试模型流程图。 图示展示了测试工作流程,展示了输入图像如何通过训练好的模型处理以生成说明并评估性能。 请点击此处查看该图的放大版本。
ResNet-152 图像字幕算法
初始化输入和输出参数,输入即为MSCOCO图像集合,即I = (i1, i2, i3, ....... iN)注释 J = (j1, j2, j3, ......... jN)输出以字幕形式计算。在第一步,需要输入,然后通过调整宽高比对图像进行预处理,如
(44)
其中w和h是图像的原始宽度和高度,w新和 h 为重新调整尺寸,Ts 被视为预定义的目标尺寸(Ts = 224),最大尺寸(w, h)定义最大尺寸,并已按比例调整以保持宽高比。
特征提取后,需要声明单位块为
(45)
然后初始化参数,比如批次大小、纪元数、隐藏层的权重隐藏的 W、输出层的 W 以及 B高度,B偏差作为偏差。初始化完成后,需要计算卷积层的输出。
(46)
如果 bl 等价于 1,则可以视为正常的 ReLU 块。但如果 bl 不等于 1 或等价于 0,那么它将是;
(47)
然后计算生存可行性
(48)
其中 FK 被视为系统的存活可行性,K 表示模型中块的总数。然后计算概率分布
(49)
计算完概率分布后,构建模型以访问并解码数据。
/9500
K1、K2、K3、K4、......、K T-1 是隐藏的解码态。
访问模型时,需要应用注意力机制来生成字幕,将候选字幕与参考字幕进行评估;最终指标可通过BLEU、METEOR、CIDEr和ROUGE进行评估。