Transformer 结构
基于 Encoder-Decoder结构,6个Encoder递进,6个Decoder递进
每一个Encoder和Decoder内部结构 (Multi-Head Attention + FeedForward)
Encoder
Encoder结构,Self-Attention + FeedForward(并行)
Positional Encoding
Transformer不能记录document前后顺序,需要加入positional encoding
positional encoding (even number)
positional encoding (odd number)
Word Embeddings + Positional Encoding = Final Embedding,然后将 Final Embedding 输入到Encoder中
Self-Attention
Step1: softmax (Q * K div 8), here 8 is sqrt(dimension)
Multi-Head Attention
上面的Self-Attention 计算了一组QKV,获得一个Attention
Multi-Head Attention 并行计算8组QKV,获得8个Attention
Layer Normalization
Batch Normalization
按批次归一,数据偏差会较大,会导致梯度消失或梯度爆炸
Layer Normalization
Decoder
Masked Multi-Head Attention
Padding Mask
在长度不够位置上填充较大值的负数
Sequence Mask
使Decoder只能使用t时刻前的输出,将之后的输出隐藏