🧠 图解记忆: 先复现再分层定位,用 Trace 和固定测试集验证根因,而不是凭感觉改 Prompt。
💡 答案要点
排查流程:
┌─────────────────────────────────────────────────────────┐
│ AI 应用问题排查流程 │
└─────────────────────────────────────────────────────────┘
问题报告 → 复现问题 → 定位环节 → 分析原因 → 修复验证
↓ ↓ ↓ ↓ ↓
收集信息 最小化 逐层排查 根因分析 回归测试逐层排查法:
| 层级 | 检查内容 | 工具/方法 |
|---|---|---|
| 接入层 | 请求是否到达? | 日志、监控 |
| 网关层 | 鉴权/限流是否通过? | Gateway 日志 |
| 业务层 | 业务逻辑是否正确? | 单元测试 |
| AI 层 | Prompt 是否正确? | Prompt 调试工具 |
| 模型层 | 模型调用是否成功? | API 日志 |
| 数据层 | 检索结果是否正确? | 向量库查询 |
| 输出层 | 响应是否正确返回? | 响应日志 |
常见问题及排查:
| 问题 | 可能原因 | 排查方法 |
|---|---|---|
| 回答不准确 | Prompt 问题/检索问题 | 检查 Prompt/检索结果 |
| 响应慢 | 模型慢/检索慢 | 检查各环节延迟 |
| 成本高 | Token 过多/缓存失效 | 检查 Token 消耗 |
| 频繁报错 | API 限流/服务故障 | 检查错误日志 |
| 内容违规 | 安全过滤失效 | 检查审核日志 |
面试话术:
"我用逐层排查法:从接入层到输出层,逐层检查。特别是 AI 层,我会用 LangSmith 等工具查看完整的 Prompt 和响应,快速定位是 Prompt 问题还是模型问题。"
