Skip to content
🔗 分享本题
查看我的学习进度 →

AI系统设计从需求约束到架构取舍监控降级和回滚的方法图解

🧠 图解记忆: 先澄清规模、目标和边界,再画关键链路并权衡质量、延迟与成本,最后补验证和兜底。

💡 答案要点

通用设计模板:

  1. 需求澄清(5 分钟)

    - 用户规模:日活、并发量
    - 功能边界:核心功能 vs 扩展功能
    - 性能要求:响应时间、准确率
    - 成本约束:算力、存储、API 调用
  2. 架构设计(15 分钟)

    用户请求 → API 网关 → 业务层 → AI 层 → 数据层
    
    - 业务层:鉴权、限流、日志
    - AI 层:LLM、向量检索、Agent 编排
    - 数据层:向量库、关系型数据库、缓存
  3. 技术选型(10 分钟)

    - LLM:GPT-4(高质量)vs DeepSeek(成本低)
    - 向量库:Milvus(大规模)vs Chroma(轻量级)
    - 框架:LangChain(生态)vs 自研(灵活)
  4. 性能优化(10 分钟)

    - 缓存:相似问题缓存,减少 LLM 调用
    - 批处理:批量向量化,提升吞吐
    - 流式输出:降低首字延迟
    - 异步处理:长任务异步化
  5. 监控运维(5 分钟)

    - 日志:请求日志、错误日志、慢查询
    - 指标:QPS、延迟、准确率、成本
    - 告警:错误率、延迟、API 配额

示例题:设计一个智能客服系统

1. 需求:
   - 10w DAU,峰值 QPS 100
   - 支持多轮对话、知识库检索、订单查询
   - 响应时间 < 2s,准确率 > 85%

2. 架构:
   用户 → API 网关 → 对话管理 → Agent 编排 → 工具调用

                            [LLM] [知识库] [订单系统]

3. 技术栈:
   - LLM:GPT-4o-mini(成本与质量平衡)
   - 向量库:Milvus(知识库 50w 文档)
   - 框架:LangChain(快速开发)
   - 缓存:Redis(高频问题缓存)

4. 优化:
   - 相似问题缓存(命中率 30%,节省 API 成本)
   - 混合检索(BM25 + 向量,召回率 95%)
   - 人工介入(置信度 < 0.7 转人工)

📚 参考:System Design Primer(系统设计准备)