🧠 图解记忆: 生产部署不是把 Demo 上云,而是用限流、超时、重试、降级、监控和安全把不确定模型变成可靠服务。
💡 答案要点
部署架构:
用户 → CDN → 负载均衡 → API Gateway → 服务集群 → LLM API
↓
Redis 缓存
↓
监控告警关键注意事项:
| 方面 | 注意点 | 解决方案 |
|---|---|---|
| 延迟 | LLM 响应慢 | 流式输出、缓存 |
| 成本 | Token 费用高 | 模型路由、压缩 |
| 稳定性 | API 可能失败 | 重试、降级、多 Key 轮询 |
| 安全 | Prompt Injection | 输入过滤、输出审核 |
| 监控 | 难以追踪问题 | 完整链路日志、RAGAS 监控 |
部署清单:
- [ ] 限流配置(令牌桶)
- [ ] 缓存策略(语义缓存)
- [ ] 超时设置(首字<5s)
- [ ] 降级方案(LLM 挂了返回预设答案)
- [ ] 监控告警(成本、延迟、错误率)
- [ ] 日志记录(完整请求链路)
面试话术:
示例表达(仅在能用本人经历或可复现实验佐证时使用): "我部署 AI 应用时,核心是稳定性。LLM API 可能失败,我设计了多 Key 轮询 + 重试 + 降级三层防护。同时用流式输出降低首字延迟,用语义缓存降低成本。监控方面,我追踪每个请求的完整链路,一旦成本或延迟异常就告警。"
