MODULE 12 · PROGRESS 0%
Continued Pretraining:让模型真正吸收领域语言分布
理解何时该继续预训练、数据规模、灾难性遗忘和与 SFT 的顺序。
12.1 它和 SFT 不一样
SFT 的数据通常是“指令 → 理想回答”;Continued Pretraining 更接近原始语言模型训练,用大量领域文本继续 next-token prediction。目标是让模型适应专业术语、文体和知识分布。比如法律、医学、代码、某个大型企业知识域,都可能受益。
12.2 什么时候值得做
如果你的问题只是“回答要更符合一种格式”,优先 SFT;如果模型对领域语言本身理解明显不足,且你拥有大量高质量原始语料,才考虑 Continued Pretraining。它比 LoRA SFT 更重,也更容易损伤通用能力。
12.3 数据准备
领域语料要做去重、质量过滤、版权与隐私审查、语言识别、长度处理。预训练数据规模通常用 token 计量。你应先做数据统计报告:文档数、token 数、来源、重复率、语言比例、敏感数据风险。
12.4 灾难性遗忘
只用狭窄领域数据继续训练可能让模型过度偏向领域,通用能力下降。常见缓解思路包括混入一定比例通用数据、降低学习率、控制训练步数,并且对通用 benchmark 做回归评测。
12.5 顺序
常见路线是 Base → Continued Pretraining → SFT → Preference Alignment。不是所有项目都必须四步全做。对于个人,第一个真正产品通常只需要好的 Base + SFT/LoRA + Eval。把 Continued Pretraining 放到你有明确证据证明“基础领域能力不够”时再做。
动手实验:不做完不算学完
常见错误 / 排错提醒
- 因为“听起来高级”就做 CPT
- 把 SFT 问答混成原始语料却不知道训练目标
- 没有通用回归测试
本课验收产物
一份 Continued Pretraining 决策报告,而不是盲目启动昂贵训练。