PERSONAL AI LAB从零开始,真正训练自己的模型30 天实验计划
MODULE 09 · PROGRESS 0%

Evaluation:不用“感觉更聪明了”判断模型

建立固定 Benchmark、评分 Rubric、自动评测与人工抽检。

9.1 先有评测再训练

成熟流程不是“训练完再随便问几句”,而是训练之前就冻结测试集。你至少要有三个层次:能力测试、格式/约束测试、真实业务任务测试。这样模型改了以后才能知道到底改善了什么、伤害了什么。

9.2 Point-based Rubric

复杂任务适合把评分拆成明确项目。例如 PRD:需求理解 15、目标用户 10、闭环 15、架构 15、任务拆解 15、风险 10、验收标准 10、非模板化 10。每项都写清楚 0 分和满分标准,否则 LLM Judge 也会漂移。

9.3 自动 Eval 与人工 Eval

自动评测适合格式、关键词、单元测试、结构完整性和大规模初筛;LLM-as-a-Judge 适合主观质量但会有偏差;人工评测昂贵但最接近真实需求。正确方式是组合,而不是迷信某一种。

9.4 Pairwise Comparison

很多时候“给一个答案打 83 分”不稳定,但让评审比较 A 与 B 哪个更好容易得多。因此训练前后模型可以用 pairwise win-rate:同一个 prompt 输出 A/B,随机打乱顺序,让评审选择更优。

9.5 回归测试

模型针对一个领域微调后,可能损伤通用行为。每次新版本都跑同一套回归测试,包括安全、格式、中文表达、长回答、拒答边界等。只有目标指标上升且关键回归不恶化,才能升级版本。

本课最小代码 / 结构

{
  "id":"prd-001",
  "prompt":"设计一个AI小说工作台",
  "rubric":{
    "closed_loop":20,
    "architecture":20,
    "execution":20,
    "risk":20,
    "depth":20
  }
}

动手实验:不做完不算学完

常见错误 / 排错提醒

  • 测试集每次都换,结果无法比较
  • 只测试训练目标,不测回归
  • 让同一个模型既回答又给自己打分且无约束

本课验收产物

一个版本化 Benchmark + 第一份模型评测报告。