🧠 图解记忆: 先把成本归因到每个请求,再用缓存、路由和上下文治理降低单位任务成本。
💡 答案要点
成本组成:
总成本 = LLM 调用成本 + 向量数据库成本 + 服务器成本
(70%) (20%) (10%)监控指标:
| 指标 | 说明 | 告警阈值 |
|---|---|---|
| 每日 Token 消耗 | 输入 + 输出 | 超过预算 20% |
| 单次调用成本 | 平均每次请求的费用 | > $0.01 |
| 缓存命中率 | 缓存命中的比例 | < 30% |
| 模型分布 | 各模型调用比例 | 大模型占比过高 |
优化策略:
| 策略 | 说明 | 节省比例 |
|---|---|---|
| 语义缓存 | 相似问题直接返回 | 30-50% |
| 模型路由 | 简单问题用小模型 | 30-40% |
| Prompt 压缩 | LLMLingua 压缩 | 40-90% |
| 批量处理 | 多个请求合并 | 10-20% |
面试话术:
"我搭建了成本监控看板,实时追踪 Token 消耗和费用。有一次发现成本突增,通过追踪发现是一个 Prompt 泄露了系统指令,导致模型输出了大量无效内容。修复后,我加入了 Prompt 长度限制和输出审核,成本稳定在预算内。"
📚 参考:LiteLLM(成本监控与预算控制)
