PERSONAL AI LAB从零开始,真正训练自己的模型30 天实验计划
MODULE 01 · PROGRESS 0%

零基础 Python:只学训练模型真正会用到的部分

不用系统学完整门语言,先掌握变量、列表、字典、循环、函数、文件、JSON 和虚拟环境。

1.1 变量和数据结构

训练代码里最常见的是字符串、整数、浮点数、列表和字典。模型配置通常就是一个巨大字典;数据集通常是一组字典;训练日志通常是一串数字。你不用背语法,只要做到“看到代码能改参数、能打印变量、能读取 JSON”。

1.2 列表与循环

数据清洗本质上经常就是遍历样本:逐条读取 instruction、response,去掉空白、过滤过短内容、拼接聊天模板。for 循环是你以后最常见的工具之一。要养成小批量先跑的习惯,比如先拿前 10 条数据测试处理逻辑,而不是第一次就处理 10 万条。

1.3 函数

把重复操作封装成函数,例如 clean_text(text)、format_sample(sample)、score_answer(answer)。函数的价值不是“代码高级”,而是让实验可复用、可测试。未来 Dataset Pipeline 和 Eval Pipeline 都会大量依赖函数。

1.4 JSON / JSONL

LLM 数据最常见格式之一是 JSONL:每一行就是一条 JSON。它适合流式读取,也方便追加。常见字段包括 messages、instruction、input、output、chosen、rejected。你必须学会打开一条样本检查,而不是只相信生成脚本。

1.5 虚拟环境

不同训练项目依赖版本可能冲突,所以每个项目尽量有独立环境。你需要理解 python -m venv .venv、source .venv/bin/activate、pip install、pip freeze。以后出现“昨天能跑今天不能跑”,第一件事就检查环境和包版本。

本课最小代码 / 结构

import json

with open("data.jsonl", "r", encoding="utf-8") as f:
    for line_no, line in enumerate(f, 1):
        sample = json.loads(line)
        print(line_no, sample["instruction"])

动手实验:不做完不算学完

常见错误 / 排错提醒

  • 复制命令但不知道当前目录
  • pip 装到系统 Python,项目却使用另一个环境
  • 看到报错就全贴给 AI,不先读 traceback 最后一行

本课验收产物

一个可以读取和检查训练数据的 Python 小工具。