🧠 图解记忆: 好答案要承担自己的判断,说明影响和根因,并证明 POC、评审、灰度与回滚流程已经因此改变。
💡 答案要点
STAR 法则 + 复盘思维
禁忌:
❌ "我没有失败过"(太假)
❌ "我不记得了"(没有反思能力)
❌ "那不是我的错"(推卸责任)
❌ "失败的项目是别人的原因"(甩锅)模板(直接可背):
【项目背景】
在上一家公司,我负责设计一个实时推荐系统,需要在 100ms 内返回推荐结果。
【错误决策】
我选择了 Elasticsearch 做向量检索,原因是我之前用过 ES,比较熟悉。但 ES 的向量检索性能不如专门的向量数据库(如 Milvus),而且 ES 的扩展性有限。
【失败后果】
系统上线后,P99 延迟超过 800ms,用户投诉率上升,最终不得不重构。
【深度复盘】
"回头看,我犯了三个错误:
① 技术选型凭经验而不是数据:我没有做性能基准测试,完全基于熟悉度选型
② 没有请教专家:我应该先咨询向量数据库团队,而不是自己硬扛
③ 忽视业务增长:我只考虑了当前数据量,没考虑 3 个月后的增长"
【改进措施】
"这次失败之后,我建立了技术选型的 checklist:
① 性能基准测试(至少测 3 个候选方案)
② POC 验证(用真实数据跑一周)
③ 架构评审(请资深工程师 review)
④ 制定回滚方案"
【现在的方法】
"我现在做技术选型,会先问自己三个问题:
1. 这个选择的最坏情况是什么?能接受吗?
2. 我有没有遗漏什么更优方案?
3. 如果错了,我怎么知道,怎么回滚?"AI 应用工程师专属版本:
【项目背景】
我曾经在一个 RAG 项目中选择了小模型(DeepSeek-V4-Flash)来节省成本,认为它足够处理简单问答。
【错误决策】
没有做 A/B 测试,直接全量上线。
【失败后果】
用户反馈"回答太水",客服投诉率上升,最终不得不换成 GPT-4,成本反而更高(因为换了两次)。
【复盘】
"我错在:① 过度优化成本而忽视了质量;② 没有做灰度测试就全量上线;③ 没有建立评估指标就上线了。正确的做法是:先用 GPT-4 做 baseline → 和小模型做对比评估 → 确认质量差距可接受后再考虑降本。"
【改进】
"现在我的 AI 项目上线流程是:
① 用当前最优模型跑 baseline,记录指标
② 用候选模型跑对比测试
③ 质量差距 < 5% 才考虑换
④ 灰度 5% → 20% → 100%"面试话术:
"我最失败的技术决策是在 RAG 项目中过早优化成本,用 DeepSeek V4-Flash 替代 GPT-4,结果用户反馈很差,最终成本反而更高(因为换了两次)。这次失败让我建立了'质量优先,分级验证'的上线流程:先用最优模型做 baseline,确认质量可接受后再优化成本。"
📚 参考:Amazon Leadership Principles(Ownership / Learn and Be Curious)
