Skip to content
🔗 分享本题
查看我的学习进度 →

RAG项目用STAR串联检索生成性能成本指标及评测口径图解

🧠 图解记忆: 项目数字必须同时说明指标口径、基线、测试集和统计条件,才经得住面试官继续追问。

💡 答案要点

STAR 法则:Situation / Task / Action / Result

核心原则:量化!量化!量化!

模板(直接可背)

【Situation】项目背景
我负责设计并落地公司知识库问答系统的 RAG 架构,支持 500 万注册用户,日均请求 80 万次。

【Task】核心技术挑战
当时面临三大挑战:① 历史文档超 10 万篇,跨部门检索准确率仅 45%;② 复杂问题(如"对比竞品A和竞品B的技术方案")需要多跳推理;③ 用户期望秒级响应,但当时的 P99 超过 5 秒。

【Action】具体技术方案
我主导了以下技术优化:
- 引入混合检索(向量 + BM25),召回率从 45% → 78%
- 设计两阶段 Rerank(向量初筛 → Cross-Encoder 重排),准确率提升 35%
- 实现语义缓存层,相同问题命中缓存直接返回,延迟从 800ms → 120ms
- 部署 SGLang + TensorRT-LLM 推理优化,吞吐提升 4 倍

【Result】量化成果
最终系统:检索准确率 91%(+46%),P99 延迟 280ms(-64%),日均承载 80 万次请求,年度为公司节省 API 成本 120 万元。

量化指标速查表

维度指标差 → 好
检索Recall@5 / MRR45% → 78%
准确率HitRate / NDCG@1055% → 91%
延迟P50 / P99800ms → 120ms
吞吐QPS / 并发用户数200 → 2000
成本单次请求成本 / 月度账单↓60%
业务用户满意度 / 解决率65% → 88%

AI Agent 项目的 STAR 模板

【Situation】
公司的客服场景需要 AI Agent 自动处理用户问题,高峰期排队 1000+ 人,人工成本高。

【Task】
设计一个多 Agent 协作系统,实现:问题分类 → 意图识别 → 工具调用 → 答案生成全流程自动化。

【Action】
- 设计 ReAct Agent 架构,每轮推理包含 Thought/Action/Observation
- 引入 Tool Agent 专门处理 API 调用(日历/订单/库存)
- 实现 Human-in-the-Loop:置信度 < 0.7 自动转人工
- 引入 Conversation Memory Agent,长期记忆用户偏好

【Result】
AI Agent 独立解决率 73%,人工介入率从 85% → 27%,客服团队人效提升 3 倍,用户满意度从 3.2 → 4.6(5分制)。

面试话术:

"我习惯用 STAR 法则描述项目,重点是量化成果。比如 RAG 项目,我会说'召回率从 45% 提升到 78%,延迟从 800ms 降到 120ms',而不是'我优化了 RAG 系统'。数字最有说服力,面试官能立刻判断项目深度。"

📚 参考:STAR 法则(Wikipedia:Situation, Task, Action, Result)