记忆点:说明任务与验收标准,不要替推理模型规定每一步思路。
💡 答案要点
推理模型(o3/R1/QwQ)和普通模型的 Prompt 策略完全不同:
| 维度 | 普通模型(GPT-4o/Claude) | 推理模型(o3/R1) |
|---|---|---|
| CoT 效果 | 有效,"请一步步思考"提升推理 | 反而降低性能! |
| Few-shot | 有效,给示例模仿 | 可能干扰内部推理机制 |
| System Prompt | 详细指令有效 | 越简洁越好,让模型自由推理 |
| Temperature | 0.0-1.0 可调 | 通常自动(强制随机) |
为什么 CoT 对推理模型不起作用(甚至反效果):
普通模型:输入 → "请一步步思考" → 模型输出推理过程 → 答案
↑ 你告诉它思考方式
推理模型:输入 → 模型内部已有"思考预算"机制 → 直接内部推理 → 答案
↑ 你再教它"思考"等于干扰它的内部机制2026年主流推理模型分类:
| 类型 | 代表模型 | 思考方式 | Prompt 策略 |
|---|---|---|---|
| 显式思考 | o3、DeepSeek R1、QwQ-32B | 输出中可见思考链 | ❌ 不要加 CoT |
| 隐式思考 | Gemini 2.5 Pro | 内部思考 | ✅ 简洁指令 |
| 可配置思考 | Claude Sonnet 4(Extended Thinking) | thinking.budget_tokens 控制 | ✅ 指定预算即可 |
生产级推理模型 Prompt 最佳实践:
python
# ❌ 错误:对推理模型加 CoT
messages = [
{"role": "user", "content": "请一步步思考这个问题:计算 123*456"},
]
# ✅ 正确:推理模型直接给任务
messages = [
{"role": "user", "content": "计算 123*456"},
# 不需要"请思考",模型会自动推理
]
# ✅ 正确:Extended Thinking 模型配置预算
response = anthropic.messages.create(
model="claude-sonnet-4-5",
thinking={
"type": "enabled",
"budget_tokens": 8192 # 控制思考量
},
messages=messages
)场景化推理模型选择:
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| 数学/代码推理 | o3 或 DeepSeek R1 | 显式思考链可验证 |
| 快速简单问答 | 普通模型(省钱) | 推理模型贵 10x |
| 需要控制成本 | Claude Sonnet 4(可配置预算) | 预算内自由推理 |
| 本地部署 | QwQ-32B(开源) | 免费、可定制 |
面试话术:
"2026 年面试要注意推理模型和普通模型的 Prompt 策略是反的。普通模型加 CoT 提示词效果很好,但推理模型(o3/R1)内部已经有思考机制,你再教它'一步步思考'反而干扰它。我面试被问到过这个坑——面试官问'CoT 对 o1 有用吗',我说有用,直接挂掉。正确答案是:推理模型不需要外部 CoT,它的思考是内化的,你应该关心的是 Thinking Budget 配置,而不是 Prompt 怎么写。"
