MODULE 07 · PROGRESS 0%
Transformer 与 Attention:从“会用”到“看懂模型结构”
理解 Q/K/V、causal mask、multi-head、MLP 和残差,不要求手推论文但能读实现。
7.1 Attention 的直觉
一句话中当前位置生成下一个 token 时,需要决定“前面哪些 token 更值得关注”。Attention 通过 Query、Key 的相似度形成权重,再对 Value 加权汇总。你可以把它理解为动态检索,但它不是数据库查找,而是连续向量计算。
7.2 Q / K / V
同一份隐藏状态分别经过三个线性映射得到 Q、K、V。Q 表示当前位置要找什么,K 表示各位置提供什么匹配信号,V 是真正被汇总的信息。QK^T 得到分数,除以 sqrt(d) 稳定数值,再 softmax 得到权重。
7.3 Causal Mask
自回归模型训练时,一整个序列可以并行计算,但第 t 个位置不能偷看未来 token。因此要把未来位置 mask 掉。没有 causal mask,模型训练时会看到答案,推理时却看不到,任务就被破坏。
7.4 Multi-head
一个 attention head 只能在一个子空间里形成模式。多头把维度切分,让不同 head 并行学习不同关系,再拼接。不要执着于“某个 head 一定代表语法”,真实模型里的功能往往是分布式的。
7.5 MLP、Residual、Norm
Attention 之后通常还有 MLP,用来做逐位置的非线性特征变换;Residual 让输入绕过子层直接相加,帮助深层网络训练;Norm 控制数值尺度。一个 Transformer block 就是这些组件的组合。
动手实验:不做完不算学完
常见错误 / 排错提醒
- 把 Attention 等同于长期记忆
- 认为模型“查找事实”一定是某个 attention head 完成
- 只背 QKV 公式却不知道 tensor shape
本课验收产物
一张 Transformer Block 手绘图 + 你自己的中文解释。