PERSONAL AI LAB从零开始,真正训练自己的模型30 天实验计划
MODULE 14 · PROGRESS 0%

GPU、显存、量化与云训练:知道钱花在哪

能够估算训练资源、选择设备、读 OOM,并建立成本纪律。

14.1 参数为什么占显存

以 FP16/BF16 粗略估算,一个参数权重约 2 bytes。7B 权重本身约 14GB,但训练远不止权重:还要梯度、优化器状态、激活值等,所以全参数训练显存会远大于 14GB。LoRA、量化、gradient checkpointing 都是在不同位置省内存。

14.2 OOM 怎么排

Out Of Memory 不要第一反应换最贵 GPU。按顺序检查:batch size、sequence length、gradient accumulation、precision、是否启用 gradient checkpointing、量化方式、模型大小。sequence length 翻倍对 attention 内存/计算的影响可能非常明显。

14.3 CUDA

主流训练生态大量依赖 NVIDIA CUDA。你不需要会写 CUDA kernel,但要理解驱动、CUDA runtime、PyTorch CUDA build、GPU 型号之间存在兼容关系。环境问题最好锁版本,不要随意“全部升级到最新”。

14.4 云 GPU 成本纪律

每次开云机器前准备好代码和小样本,在本地先完成静态检查;开机后先跑 20–100 step smoke test;确认日志和 checkpoint 正常再跑长训练;结束立即停止实例。每个实验记录 GPU 型号、小时数和成本。

动手实验:不做完不算学完

常见错误 / 排错提醒

  • 云 GPU 开着调代码几小时
  • OOM 后只会换机器
  • 不记录训练时长和成本

本课验收产物

一份你自己的 GPU 选择与成本表。