MODULE 04 · PROGRESS 0%
第一次运行开源模型:把“网站里的 AI”变成你电脑里的模型
完成本地/云端推理,理解模型文件、Tokenizer、显存和生成参数。
4.1 Base / Instruct
Base Model 更接近预训练后的“续写机器”,Instruct Model 经过指令微调和对齐,更适合聊天。零基础第一次运行优先 Instruct。以后做自己的领域模型,可以从 Instruct 做 SFT,也可以在更高级阶段从 Base 做领域继续预训练。
4.2 模型文件
常见仓库中你会看到 config.json、tokenizer.json、*.safetensors、generation_config.json 等。safetensors 主要承载权重;config 描述结构;tokenizer 决定文本如何变 token。模型不是一个神秘 exe,而是一组配置、权重和运行代码。
4.3 最小推理流程
使用 Transformers 时,基本流程是 AutoTokenizer.from_pretrained → AutoModelForCausalLM.from_pretrained → apply_chat_template → model.generate。第一次只追求“跑通”,不要急着量化、并行、改 attention backend。
4.4 Mac 与云 GPU
Apple Silicon 可以做小模型推理和部分训练实验,但生态和 CUDA 不完全相同。为了学习标准训练链路,后面最好至少体验一次 NVIDIA CUDA 云 GPU。你的 Mac 适合写代码、清数据、跑小样本、管理实验;云 GPU 负责重训练。
本课最小代码 / 结构
from transformers import AutoTokenizer, AutoModelForCausalLM
model_id = "YOUR_MODEL"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")
messages = [{"role":"user","content":"用一句话解释什么是微调"}]
text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tok(text, return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=128, temperature=0.7)
print(tok.decode(out[0], skip_special_tokens=True))动手实验:不做完不算学完
常见错误 / 排错提醒
- 第一次就下载过大模型把磁盘/内存打满
- 忽略模型 license
- 模型加载失败就盲目升级所有包
本课验收产物
EXP-002-first-inference:一份能够复现的本地或 Colab 推理记录。