队伍CICC2259 从容应队
刘宇轩 周嘉琪 冷思远
而transformer模块核心为多头注意力机制,即 Multi-Head Attention,其是由多个注意力机制Attention 组合而成。
Attention 机制实质上就是一个寻址过程,通过给定一个任务相关的查询 Query 向量 Q,通过计算与 Key 的注意力分布并附加在 Value 上,从而计算 Attention Value,这个过程实际上是 Attention 缓解神经网络复杂度的体现,不需要将所有的N个输入都输入到神经网络进行计算,而是选择一些与任务相关的信息输入神经网络,注意力机制的运算示意图如下图所示:

其中QKV的生成过程是通过三个线性层完成的,其中WQ,WK和WV是通过神经网络训练得到的权重矩阵

假设我们使用的是头数为2(Head=2)的多头注意力机制,通过将传入transformer模块的输入矩阵分割成两组数据分别进行attention运算,并将其运算结果进行拼接后输出,得到最终结果相关运算示意图如下图所示

我们还可以在注意力机制部分后面增加线性层以及激活层,还可以增加全连接前馈神经网络,以增加神经网络的复杂程度,提高拟合效果