Skip to content
🔗 分享本题
查看我的学习进度 →

推理模型提示策略动漫知识图:普通模型接受清晰指令约束与示例,推理模型接收完整问题和验收标准并自行使用推理预算

记忆点:说明任务与验收标准,不要替推理模型规定每一步思路。

💡 答案要点

推理模型(o3/R1/QwQ)和普通模型的 Prompt 策略完全不同:

维度普通模型(GPT-4o/Claude)推理模型(o3/R1)
CoT 效果有效,"请一步步思考"提升推理反而降低性能!
Few-shot有效,给示例模仿可能干扰内部推理机制
System Prompt详细指令有效越简洁越好,让模型自由推理
Temperature0.0-1.0 可调通常自动(强制随机)

为什么 CoT 对推理模型不起作用(甚至反效果):

普通模型:输入 → "请一步步思考" → 模型输出推理过程 → 答案
          ↑ 你告诉它思考方式

推理模型:输入 → 模型内部已有"思考预算"机制 → 直接内部推理 → 答案
          ↑ 你再教它"思考"等于干扰它的内部机制

2026年主流推理模型分类:

类型代表模型思考方式Prompt 策略
显式思考o3、DeepSeek R1、QwQ-32B输出中可见思考链❌ 不要加 CoT
隐式思考Gemini 2.5 Pro内部思考✅ 简洁指令
可配置思考Claude Sonnet 4(Extended Thinking)thinking.budget_tokens 控制✅ 指定预算即可

生产级推理模型 Prompt 最佳实践:

python
# ❌ 错误:对推理模型加 CoT
messages = [
    {"role": "user", "content": "请一步步思考这个问题:计算 123*456"},
]

# ✅ 正确:推理模型直接给任务
messages = [
    {"role": "user", "content": "计算 123*456"},
    # 不需要"请思考",模型会自动推理
]

# ✅ 正确:Extended Thinking 模型配置预算
response = anthropic.messages.create(
    model="claude-sonnet-4-5",
    thinking={
        "type": "enabled",
        "budget_tokens": 8192  # 控制思考量
    },
    messages=messages
)

场景化推理模型选择:

场景推荐模型理由
数学/代码推理o3 或 DeepSeek R1显式思考链可验证
快速简单问答普通模型(省钱)推理模型贵 10x
需要控制成本Claude Sonnet 4(可配置预算)预算内自由推理
本地部署QwQ-32B(开源)免费、可定制

面试话术:

"2026 年面试要注意推理模型和普通模型的 Prompt 策略是反的。普通模型加 CoT 提示词效果很好,但推理模型(o3/R1)内部已经有思考机制,你再教它'一步步思考'反而干扰它。我面试被问到过这个坑——面试官问'CoT 对 o1 有用吗',我说有用,直接挂掉。正确答案是:推理模型不需要外部 CoT,它的思考是内化的,你应该关心的是 Thinking Budget 配置,而不是 Prompt 怎么写。"