Skip to content
🔗 分享本题
查看我的学习进度 →

测试时算力与思考预算动漫知识图:推理时可根据任务复杂度分配不同思考预算,并在质量、延迟和成本之间权衡和持续评测

🧠 图解记忆:把思考预算花在值得的复杂问题上;点击图片可查看原图。

💡 答案要点

Test-Time Compute = 模型推理时消耗的算力(不是训练时)

传统观点:模型越强越好(训练时 scaling) 2026年新观点:推理时的算力分配同样重要(测试时 scaling)

核心概念:Thinking Token Budget(思考预算)

Thinking Budget = 允许模型消耗的最大"思考 tokens"数量

预算示例:
- 1024 tokens → 简单思考(简单问题)
- 8192 tokens → 深度思考(复杂问题)
- 32768 tokens → 超深度思考(数学证明)

模型行为:
预算内:模型自由思考
预算外:强制输出答案

四大厂商思考预算对比(2026年):

厂商功能配置方式思考 token 范围
AnthropicExtended Thinkingthinking.budget_tokens1024~128K
OpenAIo3 模式max_tokens(含思考)自动分配
GoogleGemini Deep ThinkthinkingBudget1024~32K
DeepSeekR1/QwQ内置思考机制开源可控

为什么重要(面试重点):

python
# 生产级思考预算策略
def route_by_complexity(question: str) -> dict:
    # 简单问题:不值得思考
    if is_simple_factual(question):
        return {"model": "claude-haiku", "thinking_budget": 0}
    
    # 中等问题:适度思考
    elif is_analysis_task(question):
        return {"model": "claude-sonnet", "thinking_budget": 4096}
    
    # 复杂问题:深度思考
    elif is_complex_reasoning(question):
        return {"model": "claude-opus", "thinking_budget": 32768}
    
    # 极限问题:超深度思考
    else:
        return {"model": "gpt-5.5-o3", "thinking_budget": 128000}

# 成本控制
# 简单问题(thinking=0):¥0.001
# 复杂问题(thinking=32K):¥0.15
# 差距 150 倍!

Inverse Scaling(反向缩放)问题:

Anthropic 2025 年研究发现:对于简单问题,推理模型反而比普通模型更差——因为思考过程可能引入干扰。

简单问题:普通模型 > 推理模型(思考干扰)
复杂问题:推理模型 >> 普通模型(思考增益)

最佳实践:

  1. 不要默认开最大思考预算 — 简单问题浪费 150x 成本
  2. 用分类模型先判断复杂度 — 再分配预算
  3. 监控思考 token 消耗 — 发现异常及时告警

面试话术:

示例表达(仅在能用本人经历或可复现实验佐证时使用): "Test-Time Compute 是 2026 年 AI 成本控制的核心技术。我的策略是'按需分配思考':简单问题直接回答(¥0.001),复杂问题开启深度思考(¥0.15)。关键是用分类模型提前判断问题复杂度,避免'大炮打蚊子'。实测这套策略可以降低 70% 的 LLM 成本,同时不损失回答质量。"