MODULE 02 · PROGRESS 0%
终端、Git 与实验目录:让每次训练都可复现
建立工程纪律:代码、数据、配置、结果、失败记录不能混在一起。
2.1 你必须会的终端命令
pwd 看当前目录,ls 看文件,cd 切换目录,mkdir 创建目录,cp 复制,mv 移动,rm 删除。你不需要成为 Linux 管理员,但训练模型大量工作发生在终端里;真正的 GPU 服务器通常也没有你熟悉的图形界面。
2.2 为什么 Git 很重要
模型实验不是“改完就完了”。你可能今天改 prompt,明天改清洗规则,后天换数据集。没有版本记录,你无法知道性能变化来自哪里。Git 至少要学会 init、status、add、commit、log、diff。大模型权重本身通常不直接塞进 Git,而是记录下载地址、哈希、配置和脚本。
2.3 一个规范实验目录
推荐每个实验都至少有 README.md、config.yaml、train.py、eval.py、data/、outputs/、logs/。README 记录目标和结论;config 保存超参数;outputs 放 adapter 或 checkpoint;logs 放 loss 和 eval 结果。以后每次训练都复制模板,而不是临时乱建文件。
2.4 Experiment ID
给每个实验唯一编号,例如 EXP-003-qwen3b-qlora-v2。编号应写进日志和评测结果。实验失败也不能删除,因为失败就是资产:它告诉你哪些参数、数据或环境组合不值得再试。
本课最小代码 / 结构
personal-ai-lab/
experiments/
EXP-001-first-model/
README.md
config.yaml
train.py
eval.py
data/
outputs/
logs/动手实验:不做完不算学完
常见错误 / 排错提醒
- 把模型权重误传 GitHub
- 每次实验覆盖同一个 output 文件夹
- 同时修改五个超参数,最后不知道哪个变量起作用
本课验收产物
一个标准化实验模板,以后所有训练都复制它。