PERSONAL AI LAB从零开始,真正训练自己的模型30 天实验计划
MODULE 15 · PROGRESS 0%

Model Serving:把模型变成你自己的 API

从“在 Notebook 能跑”升级到“其他应用可以稳定调用”。

15.1 Serving 与训练分离

训练脚本关注反向传播,Serving 关注吞吐、延迟、并发、显存和接口稳定。上线时模型通常处于 inference mode,不需要保存梯度。不要把训练 Notebook 直接当生产 API。

15.2 OpenAI-compatible API

很多推理框架支持类似 /v1/chat/completions 的接口,这样你的上层应用可以在不同模型之间切换,而不用每次重写客户端。关键是把 model_id、temperature、max_tokens、stream 等参数规范化。

15.3 量化与吞吐

部署时量化可以降低显存和成本,但可能影响质量;batching 能提高吞吐;KV cache 影响长对话性能。你不需要第一天做极致优化,先记录 P50/P95 延迟、tokens/s、最大并发和错误率。

15.4 模型版本

API 不要只叫 /model。至少有明确版本,例如 product-architect-v0.3。线上每次升级先跑 benchmark,再灰度,保留回滚能力。模型、adapter、tokenizer、prompt template 都属于版本的一部分。

动手实验:不做完不算学完

常见错误 / 排错提醒

  • 训练模型覆盖线上模型无法回滚
  • 不保存 tokenizer/chat template 版本
  • 只有“能返回”没有性能指标

本课验收产物

一个本地可调用的模型服务 + 最小 API 文档。