0%

AI 平台全流程架构(MLOps)

AI 平台全流程架构(MLOps)

一句话定位:MLOps 的核心是把”数据标注 → 训练 → 评估 → 部署 → 监控 → 反馈”变成一个闭环流水线,而不是一次性的人工串联,关键能力是可复现、可追溯、可回滚。

1. 全流程六个环节

  • 数据标注:原始数据到可训练样本的加工,需要标注质量校验与一致性检查。
  • 训练:实验管理(超参、代码版本、数据版本三者绑定),保证任意一次训练可复现
  • 评估:离线基准测试 + 人工评审,作为是否允许上线的门禁(对应 8.7 的评估门禁)。
  • 部署:模型打包、灰度发布、多版本并存。
  • 监控:线上效果指标(业务指标 + 模型指标)与资源指标(延迟、吞吐、错误率)双线监控。
  • 反馈闭环:线上数据/用户反馈回流成为下一轮训练的数据来源,形成”越用越好”的迭代循环。

2. 关键能力:血缘与可追溯

  • 模型版本与血缘:任意一个上线模型,要能追溯到”用哪份数据、哪个代码版本、哪套超参训练出来的”,这是排查线上问题(效果突然下降)的前提。
  • 实验可复现:同样的代码 + 数据 + 超参,任何人任何时候跑出来的结果应该一致(或在可接受误差内),否则无法信任对比实验的结论。

3. 面试落点

  • 能画出这六个环节的闭环图,并指出每个环节最容易出问题的地方(标注质量、训练不可复现、评估门禁形同虚设、监控缺失导致线上问题发现滞后)。
  • 可迁移话术:这套闭环和大数据平台的”数据接入 → ETL → 存储 → 查询 → 监控告警”全链路思路是同构的,只是流转的对象从数据变成了模型,多了”训练”和”评估门禁”两个 AI 特有环节。

参考:Google Cloud《MLOps: Continuous delivery and automation pipelines in machine learning》