MODULE 01 · PROGRESS 0%
零基础 Python:只学训练模型真正会用到的部分
不用系统学完整门语言,先掌握变量、列表、字典、循环、函数、文件、JSON 和虚拟环境。
1.1 变量和数据结构
训练代码里最常见的是字符串、整数、浮点数、列表和字典。模型配置通常就是一个巨大字典;数据集通常是一组字典;训练日志通常是一串数字。你不用背语法,只要做到“看到代码能改参数、能打印变量、能读取 JSON”。
1.2 列表与循环
数据清洗本质上经常就是遍历样本:逐条读取 instruction、response,去掉空白、过滤过短内容、拼接聊天模板。for 循环是你以后最常见的工具之一。要养成小批量先跑的习惯,比如先拿前 10 条数据测试处理逻辑,而不是第一次就处理 10 万条。
1.3 函数
把重复操作封装成函数,例如 clean_text(text)、format_sample(sample)、score_answer(answer)。函数的价值不是“代码高级”,而是让实验可复用、可测试。未来 Dataset Pipeline 和 Eval Pipeline 都会大量依赖函数。
1.4 JSON / JSONL
LLM 数据最常见格式之一是 JSONL:每一行就是一条 JSON。它适合流式读取,也方便追加。常见字段包括 messages、instruction、input、output、chosen、rejected。你必须学会打开一条样本检查,而不是只相信生成脚本。
1.5 虚拟环境
不同训练项目依赖版本可能冲突,所以每个项目尽量有独立环境。你需要理解 python -m venv .venv、source .venv/bin/activate、pip install、pip freeze。以后出现“昨天能跑今天不能跑”,第一件事就检查环境和包版本。
本课最小代码 / 结构
import json
with open("data.jsonl", "r", encoding="utf-8") as f:
for line_no, line in enumerate(f, 1):
sample = json.loads(line)
print(line_no, sample["instruction"])动手实验:不做完不算学完
常见错误 / 排错提醒
- 复制命令但不知道当前目录
- pip 装到系统 Python,项目却使用另一个环境
- 看到报错就全贴给 AI,不先读 traceback 最后一行
本课验收产物
一个可以读取和检查训练数据的 Python 小工具。