🧠 图解记忆: Prompt 优化是实验工程:固定数据、一次改一项,用指标和样例共同验收。
💡 答案要点
调试工具:
- LangSmith(LangChain 官方)
- Promptfoo(开源)
- 自建:记录 Prompt + 响应 + 评分
优化方法:
| 方法 | 说明 | 效果 |
|---|---|---|
| A/B 测试 | 对比不同 Prompt 的效果 | 找到最优版本 |
| Few-shot | 增加示例 | 提升格式一致性 |
| CoT | 让模型逐步思考 | 提升推理能力 |
| 约束增强 | 明确输出格式和限制 | 减少幻觉 |
| 角色设定 | 给模型设定专业角色 | 提升专业度 |
调试流程:
1. 记录基线:当前 Prompt 的效果
2. 提出假设:哪里可以改进
3. 修改 Prompt:应用优化方法
4. 测试评估:跑测试集评分
5. 对比分析:是否提升
6. 迭代优化:重复 2-5实现示例:
python
# 用 Promptfoo 做 A/B 测试
# prompt_a.yaml
prompts:
- "你是一个客服助手,请回答问题:{{question}}"
# prompt_b.yaml
prompts:
- |
你是一个专业的客服助手。
请基于以下知识回答问题,不要编造信息。
知识:{{context}}
问题:{{question}}
回答:
# 运行测试
promptfoo eval --prompts prompt_a.yaml --prompts prompt_b.yaml面试话术:
"我维护了 50+ 个 Prompt 版本,每个版本都记录了测试分数。优化 Prompt 我常用 A/B 测试,用测试集跑分,谁效果好用谁。另外,Few-shot 和 CoT 是最有效的两种优化方法。"
📚 参考:Anthropic Prompt Engineering 文档 · promptfoo(Prompt 迭代测试)
