
🧠 记忆锚点:LLMOps 扩展而不是替代 MLOps;上线后还要运维 Prompt、索引、路由、评测与工具权限,并把告警关联到精确版本。
💡 答案要点
MLOps vs LLMOps 核心区别:
| 维度 | MLOps(传统 ML) | LLMOps(大模型) |
|---|---|---|
| 模型产物 | 自训练模型权重 | 调用第三方 API / 本地推理服务 |
| 版本管理 | 模型版本 + 数据版本 | Prompt 版本 + RAG 知识库版本 |
| 漂移检测 | 特征分布漂移 | 输入意图漂移 + 输出质量漂移 |
| 评估指标 | Accuracy / AUC | Faithfulness / 幻觉率 / 满意度 |
| 调试工具 | TensorBoard / MLflow | LangSmith / Langfuse / Arize |
| 成本结构 | GPU 算力成本 | Token 消耗成本(按 API 计费) |
LLM 应用的完整运维体系:
┌─────────────────────────────────────────────────────────┐
│ LLMOps 四大支柱 │
├──────────────┬──────────────┬──────────────┬────────────┤
│ 1. Prompt │ 2. 质量监控 │ 3. 成本控制 │ 4. 知识库 │
│ 版本管理 │ │ │ 运维 │
├──────────────┼──────────────┼──────────────┼────────────┤
│ • Git管理 │ • RAGAS 采样 │ • Token预算 │ • 增量更新 │
│ Prompt │ 评估 │ 告警 │ • 版本切换 │
│ • A/B测试 │ • 幻觉率监控 │ • 模型路由 │ • 效果对比 │
│ • 灰度发布 │ • 用户反馈 │ • 缓存命中率 │ • 脏数据 │
│ • 回滚机制 │ • P99 TTFT │ • 批量优化 │ 治理 │
└──────────────┴──────────────┴──────────────┴────────────┘Prompt 版本管理实战:
go
// Prompt 版本化存储(Git + 数据库双备份)
type PromptVersion struct {
ID string `json:"id"`
Name string `json:"name"`
Version string `json:"version"` // v1.0.0
Content string `json:"content"`
CreatedAt time.Time `json:"created_at"`
Metrics struct {
AvgFaithfulness float64 `json:"avg_faithfulness"` // RAGAS 指标
HallucinRate float64 `json:"hallucin_rate"`
UserSatisfy float64 `json:"user_satisfy"`
} `json:"metrics"`
}
// A/B 测试路由
func routePrompt(userID string) *PromptVersion {
// 哈希分流:10% 流量走新版本
if hash(userID) % 10 == 0 {
return getPromptVersion("v2.0.0-canary")
}
return getPromptVersion("v1.0.0-stable")
}质量监控关键指标(面试必背):
| 指标 | 含义 | 告警阈值 | 工具 |
|---|---|---|---|
| Faithfulness | 答案是否忠于检索内容 | < 0.85 告警 | RAGAS |
| 幻觉率 | 答案包含无依据内容比例 | > 5% 告警 | 自定义检测 |
| TTFT P99 | 首字延迟 | > 2s 告警 | Prometheus |
| 成功率 | 请求成功完成比例 | < 98% 告警 | Prometheus |
| Token/请求 | 平均 token 消耗 | 异常增长 50% | 成本告警 |
LLMOps 工具链:
开发阶段:LangSmith / Langfuse(Trace 调试)
评估阶段:RAGAS / DeepEval(自动化评估)
生产监控:Prometheus + Grafana(指标)
成本管理:LiteLLM Gateway(统一计费)
Prompt 管理:Langfuse / PromptLayer面试话术:
"LLMOps 和 MLOps 最大的区别在于'管的东西不一样'——传统 MLOps 管的是模型训练和数据管道,LLMOps 管的是 Prompt 版本、知识库质量和 Token 成本。LLM 应用上线后我们主要维护四块:一是 Prompt 版本管理,新版本用 A/B 测试灰度验证后再全量;二是质量监控,每天采样用 RAGAS 跑 Faithfulness 和幻觉率,指标下降自动告警;三是成本控制,LiteLLM Gateway 统一管 Token 预算;四是知识库运维,每小时增量更新,文档变更后 10 分钟内新向量生效。"