PERSONAL AI LAB从零开始,真正训练自己的模型30 天实验计划
MODULE 04 · PROGRESS 0%

第一次运行开源模型:把“网站里的 AI”变成你电脑里的模型

完成本地/云端推理,理解模型文件、Tokenizer、显存和生成参数。

4.1 Base / Instruct

Base Model 更接近预训练后的“续写机器”,Instruct Model 经过指令微调和对齐,更适合聊天。零基础第一次运行优先 Instruct。以后做自己的领域模型,可以从 Instruct 做 SFT,也可以在更高级阶段从 Base 做领域继续预训练。

4.2 模型文件

常见仓库中你会看到 config.json、tokenizer.json、*.safetensors、generation_config.json 等。safetensors 主要承载权重;config 描述结构;tokenizer 决定文本如何变 token。模型不是一个神秘 exe,而是一组配置、权重和运行代码。

4.3 最小推理流程

使用 Transformers 时,基本流程是 AutoTokenizer.from_pretrained → AutoModelForCausalLM.from_pretrained → apply_chat_template → model.generate。第一次只追求“跑通”,不要急着量化、并行、改 attention backend。

4.4 Mac 与云 GPU

Apple Silicon 可以做小模型推理和部分训练实验,但生态和 CUDA 不完全相同。为了学习标准训练链路,后面最好至少体验一次 NVIDIA CUDA 云 GPU。你的 Mac 适合写代码、清数据、跑小样本、管理实验;云 GPU 负责重训练。

本课最小代码 / 结构

from transformers import AutoTokenizer, AutoModelForCausalLM

model_id = "YOUR_MODEL"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")
messages = [{"role":"user","content":"用一句话解释什么是微调"}]
text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tok(text, return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=128, temperature=0.7)
print(tok.decode(out[0], skip_special_tokens=True))

动手实验:不做完不算学完

常见错误 / 排错提醒

  • 第一次就下载过大模型把磁盘/内存打满
  • 忽略模型 license
  • 模型加载失败就盲目升级所有包

本课验收产物

EXP-002-first-inference:一份能够复现的本地或 Colab 推理记录。