Transformer 学习笔记:从整体架构到多头注意力
一份 Transformer 的学习笔记,按先整体再拆件的顺序整理:编码器与解码器的数据流;学大模型前需要回答的三个问题(神经网络、注意力机制、PyTorch 组成);Token、词嵌入矩阵与位置编码各自解决什么问题;Q、K、V 的含义,Q·K 点积为什么代表相关性,softmax 前为什么要除以维度的平方根;自注意力与交叉注意力的区别,以及交叉注意力为什么不需要掩码;训练时并行预测多个 token 而推理时逐 token 生成,因此需要因果掩码防止偷看,做法是把后文置为负无穷再经 softmax 变成 0;前馈网络、多头注意力与层归一化的定义,包括层归一化与批量归一化在归一化维度上的差别。