PERSONAL AI LAB从零开始,真正训练自己的模型30 天实验计划
MODULE 02 · PROGRESS 0%

终端、Git 与实验目录:让每次训练都可复现

建立工程纪律:代码、数据、配置、结果、失败记录不能混在一起。

2.1 你必须会的终端命令

pwd 看当前目录,ls 看文件,cd 切换目录,mkdir 创建目录,cp 复制,mv 移动,rm 删除。你不需要成为 Linux 管理员,但训练模型大量工作发生在终端里;真正的 GPU 服务器通常也没有你熟悉的图形界面。

2.2 为什么 Git 很重要

模型实验不是“改完就完了”。你可能今天改 prompt,明天改清洗规则,后天换数据集。没有版本记录,你无法知道性能变化来自哪里。Git 至少要学会 init、status、add、commit、log、diff。大模型权重本身通常不直接塞进 Git,而是记录下载地址、哈希、配置和脚本。

2.3 一个规范实验目录

推荐每个实验都至少有 README.md、config.yaml、train.py、eval.py、data/、outputs/、logs/。README 记录目标和结论;config 保存超参数;outputs 放 adapter 或 checkpoint;logs 放 loss 和 eval 结果。以后每次训练都复制模板,而不是临时乱建文件。

2.4 Experiment ID

给每个实验唯一编号,例如 EXP-003-qwen3b-qlora-v2。编号应写进日志和评测结果。实验失败也不能删除,因为失败就是资产:它告诉你哪些参数、数据或环境组合不值得再试。

本课最小代码 / 结构

personal-ai-lab/
  experiments/
    EXP-001-first-model/
      README.md
      config.yaml
      train.py
      eval.py
      data/
      outputs/
      logs/

动手实验:不做完不算学完

常见错误 / 排错提醒

  • 把模型权重误传 GitHub
  • 每次实验覆盖同一个 output 文件夹
  • 同时修改五个超参数,最后不知道哪个变量起作用

本课验收产物

一个标准化实验模板,以后所有训练都复制它。