MODULE 03 · PROGRESS 0%
大模型第一性原理:Token 到下一个词
看懂模型到底在做什么,理解“训练”为什么能改变行为。
3.1 Tokenizer
模型不直接看汉字和单词,而是先把文本切成 token ID。不同模型的 tokenizer 不一样,同一句中文在不同模型上可能变成不同数量的 token。上下文窗口、训练成本和生成速度最终都和 token 数有关。因此以后评估数据量不要只说“1000 篇文章”,而要估算 token 数。
3.2 Embedding
token ID 本身只是编号。Embedding 把编号映射到一个高维向量。训练时,这些向量会逐渐形成可用于预测的结构。你可以把它理解为模型内部“表示一个 token 的坐标”,但不要把它神化成固定的人类语义地图。
3.3 Transformer
Transformer 由一系列 block 堆叠而成,每个 block 主要包括 Attention、MLP、残差连接和归一化。Attention 让当前位置参考上下文中的其他位置;MLP 对每个位置做非线性变换。层层叠加以后,模型能够形成越来越复杂的模式。
3.4 Next-token prediction
典型自回归语言模型的核心训练目标很朴素:给前面的 token,预测下一个 token。比如“北京是中国的___”,模型输出整个词表的概率分布。真实答案对应的概率太低,就产生较高 loss;优化器利用梯度调整权重,让下次真实 token 概率更高。海量数据上重复这个过程,就形成语言能力。
3.5 Temperature 不是“智商”
生成阶段常见 temperature、top_p、top_k 都只是采样策略。temperature 较低通常更稳定,较高更随机。它不会给模型增加知识,也不会把一个不会推理的模型变会推理。
动手实验:不做完不算学完
常见错误 / 排错提醒
- 把 token 当成字符
- 把上下文窗口当成长期记忆
- 用调 temperature 解决知识和推理缺陷
本课验收产物
你能不用术语堆砌,向另一个零基础的人解释“大模型为什么能生成文字”。