| 概念 | 一句话解释 |
|---|---|
| 内容安全 | 四层防护:输入过滤、Prompt 加固、输出审核、监控举报 |
| PII 保护 | 输入输出双层脱敏,符合 GDPR |
| 防滥用 | 鉴权 + 限流 + 异常检测 + 人机验证 |
| 越狱攻击 | 绕过安全限制,DAN/角色扮演/编码/多步引导 |
| 防御策略 | 4层防护(输入/Prompt/输出/监控),防御率98% |
| LLM幻觉 | 编造虚假信息,用RAG+低温+CoT缓解,降80% |
| Prompt注入 | 恶意篡改指令,5层防护(过滤/加固/分离/验证/监控),拦截98% |
评估与测试
| 概念 | 一句话解释 |
|---|---|
| RAGAS | 忠实度、相关性、上下文精度、召回率 |
| TruLens | RAG三元组实时反馈,Feedback Functions自定义 |
| DeepEval | Pytest风格测试框架,CI/CD友好 |
| UpTrain | 开源综合评估,代码/对话/RAG多任务 |
| 黄金用例 | 标准问题 + 标准答案,用于回归测试 |
| 语义相似度 | 用 Embedding 计算答案相似度,阈值 0.8 |
| BLEU/ROUGE | 词重叠指标,适合翻译/摘要 |
| BERTScore | 语义相似度,比BLEU准确 |
| Perplexity | 困惑度,越低越流畅 |
| LLM-as-Judge | 用GPT-4评估,快速接近人类 |
| RAG Pipeline | 测试集→批量评估→阈值判断→上线/打回 |
成本优化
| 策略 | 节省比例 |
|---|---|
| 语义缓存 | 30-50% |
| Prompt 压缩 | 40-90% |
| 模型路由 | 30-40% |
| 优化检索 | 20-30% |
LangGraph
| 概念 | 一句话解释 |
|---|---|
| State | 工作流状态(TypedDict) |
| Node | 处理节点(函数) |
| Edge | 流程控制(条件路由) |
| 优势 | 支持循环、状态持久化、可视化 |