PERSONAL AI LAB从零开始,真正训练自己的模型30 天实验计划
MODULE 07 · PROGRESS 0%

Transformer 与 Attention:从“会用”到“看懂模型结构”

理解 Q/K/V、causal mask、multi-head、MLP 和残差,不要求手推论文但能读实现。

7.1 Attention 的直觉

一句话中当前位置生成下一个 token 时,需要决定“前面哪些 token 更值得关注”。Attention 通过 Query、Key 的相似度形成权重,再对 Value 加权汇总。你可以把它理解为动态检索,但它不是数据库查找,而是连续向量计算。

7.2 Q / K / V

同一份隐藏状态分别经过三个线性映射得到 Q、K、V。Q 表示当前位置要找什么,K 表示各位置提供什么匹配信号,V 是真正被汇总的信息。QK^T 得到分数,除以 sqrt(d) 稳定数值,再 softmax 得到权重。

7.3 Causal Mask

自回归模型训练时,一整个序列可以并行计算,但第 t 个位置不能偷看未来 token。因此要把未来位置 mask 掉。没有 causal mask,模型训练时会看到答案,推理时却看不到,任务就被破坏。

7.4 Multi-head

一个 attention head 只能在一个子空间里形成模式。多头把维度切分,让不同 head 并行学习不同关系,再拼接。不要执着于“某个 head 一定代表语法”,真实模型里的功能往往是分布式的。

7.5 MLP、Residual、Norm

Attention 之后通常还有 MLP,用来做逐位置的非线性特征变换;Residual 让输入绕过子层直接相加,帮助深层网络训练;Norm 控制数值尺度。一个 Transformer block 就是这些组件的组合。

动手实验:不做完不算学完

常见错误 / 排错提醒

  • 把 Attention 等同于长期记忆
  • 认为模型“查找事实”一定是某个 attention head 完成
  • 只背 QKV 公式却不知道 tensor shape

本课验收产物

一张 Transformer Block 手绘图 + 你自己的中文解释。