Skip to content
🔗 分享本题
查看我的学习进度 →

LLMOps 在 MLOps 基础上增加 Prompt、RAG、模型路由、评测集和工具权限版本治理图

🧠 记忆锚点:LLMOps 扩展而不是替代 MLOps;上线后还要运维 Prompt、索引、路由、评测与工具权限,并把告警关联到精确版本。

💡 答案要点

MLOps vs LLMOps 核心区别:

维度MLOps(传统 ML)LLMOps(大模型)
模型产物自训练模型权重调用第三方 API / 本地推理服务
版本管理模型版本 + 数据版本Prompt 版本 + RAG 知识库版本
漂移检测特征分布漂移输入意图漂移 + 输出质量漂移
评估指标Accuracy / AUCFaithfulness / 幻觉率 / 满意度
调试工具TensorBoard / MLflowLangSmith / Langfuse / Arize
成本结构GPU 算力成本Token 消耗成本(按 API 计费)

LLM 应用的完整运维体系:

┌─────────────────────────────────────────────────────────┐
│                LLMOps 四大支柱                            │
├──────────────┬──────────────┬──────────────┬────────────┤
│  1. Prompt   │  2. 质量监控 │  3. 成本控制 │ 4. 知识库  │
│  版本管理    │              │              │ 运维        │
├──────────────┼──────────────┼──────────────┼────────────┤
│ • Git管理    │ • RAGAS 采样 │ • Token预算  │ • 增量更新 │
│   Prompt     │   评估       │   告警       │ • 版本切换 │
│ • A/B测试    │ • 幻觉率监控 │ • 模型路由   │ • 效果对比 │
│ • 灰度发布   │ • 用户反馈   │ • 缓存命中率 │ • 脏数据   │
│ • 回滚机制   │ • P99 TTFT   │ • 批量优化   │   治理     │
└──────────────┴──────────────┴──────────────┴────────────┘

Prompt 版本管理实战:

go
// Prompt 版本化存储(Git + 数据库双备份)
type PromptVersion struct {
    ID        string    `json:"id"`
    Name      string    `json:"name"`
    Version   string    `json:"version"`   // v1.0.0
    Content   string    `json:"content"`
    CreatedAt time.Time `json:"created_at"`
    Metrics   struct {
        AvgFaithfulness float64 `json:"avg_faithfulness"`  // RAGAS 指标
        HallucinRate    float64 `json:"hallucin_rate"`
        UserSatisfy     float64 `json:"user_satisfy"`
    } `json:"metrics"`
}

// A/B 测试路由
func routePrompt(userID string) *PromptVersion {
    // 哈希分流:10% 流量走新版本
    if hash(userID) % 10 == 0 {
        return getPromptVersion("v2.0.0-canary")
    }
    return getPromptVersion("v1.0.0-stable")
}

质量监控关键指标(面试必背):

指标含义告警阈值工具
Faithfulness答案是否忠于检索内容< 0.85 告警RAGAS
幻觉率答案包含无依据内容比例> 5% 告警自定义检测
TTFT P99首字延迟> 2s 告警Prometheus
成功率请求成功完成比例< 98% 告警Prometheus
Token/请求平均 token 消耗异常增长 50%成本告警

LLMOps 工具链:

开发阶段:LangSmith / Langfuse(Trace 调试)
评估阶段:RAGAS / DeepEval(自动化评估)
生产监控:Prometheus + Grafana(指标)
成本管理:LiteLLM Gateway(统一计费)
Prompt 管理:Langfuse / PromptLayer

面试话术:

"LLMOps 和 MLOps 最大的区别在于'管的东西不一样'——传统 MLOps 管的是模型训练和数据管道,LLMOps 管的是 Prompt 版本、知识库质量和 Token 成本。LLM 应用上线后我们主要维护四块:一是 Prompt 版本管理,新版本用 A/B 测试灰度验证后再全量;二是质量监控,每天采样用 RAGAS 跑 Faithfulness 和幻觉率,指标下降自动告警;三是成本控制,LiteLLM Gateway 统一管 Token 预算;四是知识库运维,每小时增量更新,文档变更后 10 分钟内新向量生效。"

📚 参考:Microsoft:LLMOps Landing Zone(Azure 架构指南)