Skip to content
🔗 分享本题
查看我的学习进度 →

Prompt 版本化、单变量实验、评估与灰度发布图解

🧠 图解记忆: Prompt 优化是实验工程:固定数据、一次改一项,用指标和样例共同验收。

💡 答案要点

调试工具:

  • LangSmith(LangChain 官方)
  • Promptfoo(开源)
  • 自建:记录 Prompt + 响应 + 评分

优化方法:

方法说明效果
A/B 测试对比不同 Prompt 的效果找到最优版本
Few-shot增加示例提升格式一致性
CoT让模型逐步思考提升推理能力
约束增强明确输出格式和限制减少幻觉
角色设定给模型设定专业角色提升专业度

调试流程:

1. 记录基线:当前 Prompt 的效果
2. 提出假设:哪里可以改进
3. 修改 Prompt:应用优化方法
4. 测试评估:跑测试集评分
5. 对比分析:是否提升
6. 迭代优化:重复 2-5

实现示例:

python
# 用 Promptfoo 做 A/B 测试
# prompt_a.yaml
prompts:
  - "你是一个客服助手,请回答问题:{{question}}"

# prompt_b.yaml
prompts:
  - |
    你是一个专业的客服助手。
    请基于以下知识回答问题,不要编造信息。
    
    知识:{{context}}
    问题:{{question}}
    
    回答:

# 运行测试
promptfoo eval --prompts prompt_a.yaml --prompts prompt_b.yaml

面试话术:

"我维护了 50+ 个 Prompt 版本,每个版本都记录了测试分数。优化 Prompt 我常用 A/B 测试,用测试集跑分,谁效果好用谁。另外,Few-shot 和 CoT 是最有效的两种优化方法。"

📚 参考:Anthropic Prompt Engineering 文档 · promptfoo(Prompt 迭代测试)