MODULE 09 · PROGRESS 0%
Evaluation:不用“感觉更聪明了”判断模型
建立固定 Benchmark、评分 Rubric、自动评测与人工抽检。
9.1 先有评测再训练
成熟流程不是“训练完再随便问几句”,而是训练之前就冻结测试集。你至少要有三个层次:能力测试、格式/约束测试、真实业务任务测试。这样模型改了以后才能知道到底改善了什么、伤害了什么。
9.2 Point-based Rubric
复杂任务适合把评分拆成明确项目。例如 PRD:需求理解 15、目标用户 10、闭环 15、架构 15、任务拆解 15、风险 10、验收标准 10、非模板化 10。每项都写清楚 0 分和满分标准,否则 LLM Judge 也会漂移。
9.3 自动 Eval 与人工 Eval
自动评测适合格式、关键词、单元测试、结构完整性和大规模初筛;LLM-as-a-Judge 适合主观质量但会有偏差;人工评测昂贵但最接近真实需求。正确方式是组合,而不是迷信某一种。
9.4 Pairwise Comparison
很多时候“给一个答案打 83 分”不稳定,但让评审比较 A 与 B 哪个更好容易得多。因此训练前后模型可以用 pairwise win-rate:同一个 prompt 输出 A/B,随机打乱顺序,让评审选择更优。
9.5 回归测试
模型针对一个领域微调后,可能损伤通用行为。每次新版本都跑同一套回归测试,包括安全、格式、中文表达、长回答、拒答边界等。只有目标指标上升且关键回归不恶化,才能升级版本。
本课最小代码 / 结构
{
"id":"prd-001",
"prompt":"设计一个AI小说工作台",
"rubric":{
"closed_loop":20,
"architecture":20,
"execution":20,
"risk":20,
"depth":20
}
}动手实验:不做完不算学完
常见错误 / 排错提醒
- 测试集每次都换,结果无法比较
- 只测试训练目标,不测回归
- 让同一个模型既回答又给自己打分且无约束
本课验收产物
一个版本化 Benchmark + 第一份模型评测报告。