🧠 图解记忆:把思考预算花在值得的复杂问题上;点击图片可查看原图。
💡 答案要点
Test-Time Compute = 模型推理时消耗的算力(不是训练时)
传统观点:模型越强越好(训练时 scaling) 2026年新观点:推理时的算力分配同样重要(测试时 scaling)
核心概念:Thinking Token Budget(思考预算)
Thinking Budget = 允许模型消耗的最大"思考 tokens"数量
预算示例:
- 1024 tokens → 简单思考(简单问题)
- 8192 tokens → 深度思考(复杂问题)
- 32768 tokens → 超深度思考(数学证明)
模型行为:
预算内:模型自由思考
预算外:强制输出答案四大厂商思考预算对比(2026年):
| 厂商 | 功能 | 配置方式 | 思考 token 范围 |
|---|---|---|---|
| Anthropic | Extended Thinking | thinking.budget_tokens | 1024~128K |
| OpenAI | o3 模式 | max_tokens(含思考) | 自动分配 |
| Gemini Deep Think | thinkingBudget | 1024~32K | |
| DeepSeek | R1/QwQ | 内置思考机制 | 开源可控 |
为什么重要(面试重点):
python
# 生产级思考预算策略
def route_by_complexity(question: str) -> dict:
# 简单问题:不值得思考
if is_simple_factual(question):
return {"model": "claude-haiku", "thinking_budget": 0}
# 中等问题:适度思考
elif is_analysis_task(question):
return {"model": "claude-sonnet", "thinking_budget": 4096}
# 复杂问题:深度思考
elif is_complex_reasoning(question):
return {"model": "claude-opus", "thinking_budget": 32768}
# 极限问题:超深度思考
else:
return {"model": "gpt-5.5-o3", "thinking_budget": 128000}
# 成本控制
# 简单问题(thinking=0):¥0.001
# 复杂问题(thinking=32K):¥0.15
# 差距 150 倍!Inverse Scaling(反向缩放)问题:
Anthropic 2025 年研究发现:对于简单问题,推理模型反而比普通模型更差——因为思考过程可能引入干扰。
简单问题:普通模型 > 推理模型(思考干扰)
复杂问题:推理模型 >> 普通模型(思考增益)最佳实践:
- 不要默认开最大思考预算 — 简单问题浪费 150x 成本
- 用分类模型先判断复杂度 — 再分配预算
- 监控思考 token 消耗 — 发现异常及时告警
面试话术:
示例表达(仅在能用本人经历或可复现实验佐证时使用): "Test-Time Compute 是 2026 年 AI 成本控制的核心技术。我的策略是'按需分配思考':简单问题直接回答(¥0.001),复杂问题开启深度思考(¥0.15)。关键是用分类模型提前判断问题复杂度,避免'大炮打蚊子'。实测这套策略可以降低 70% 的 LLM 成本,同时不损失回答质量。"
