🧠 图解记忆: 先澄清规模、目标和边界,再画关键链路并权衡质量、延迟与成本,最后补验证和兜底。
💡 答案要点
通用设计模板:
需求澄清(5 分钟)
- 用户规模:日活、并发量 - 功能边界:核心功能 vs 扩展功能 - 性能要求:响应时间、准确率 - 成本约束:算力、存储、API 调用架构设计(15 分钟)
用户请求 → API 网关 → 业务层 → AI 层 → 数据层 - 业务层:鉴权、限流、日志 - AI 层:LLM、向量检索、Agent 编排 - 数据层:向量库、关系型数据库、缓存技术选型(10 分钟)
- LLM:GPT-4(高质量)vs DeepSeek(成本低) - 向量库:Milvus(大规模)vs Chroma(轻量级) - 框架:LangChain(生态)vs 自研(灵活)性能优化(10 分钟)
- 缓存:相似问题缓存,减少 LLM 调用 - 批处理:批量向量化,提升吞吐 - 流式输出:降低首字延迟 - 异步处理:长任务异步化监控运维(5 分钟)
- 日志:请求日志、错误日志、慢查询 - 指标:QPS、延迟、准确率、成本 - 告警:错误率、延迟、API 配额
示例题:设计一个智能客服系统
1. 需求:
- 10w DAU,峰值 QPS 100
- 支持多轮对话、知识库检索、订单查询
- 响应时间 < 2s,准确率 > 85%
2. 架构:
用户 → API 网关 → 对话管理 → Agent 编排 → 工具调用
↓
[LLM] [知识库] [订单系统]
3. 技术栈:
- LLM:GPT-4o-mini(成本与质量平衡)
- 向量库:Milvus(知识库 50w 文档)
- 框架:LangChain(快速开发)
- 缓存:Redis(高频问题缓存)
4. 优化:
- 相似问题缓存(命中率 30%,节省 API 成本)
- 混合检索(BM25 + 向量,召回率 95%)
- 人工介入(置信度 < 0.7 转人工)