🧠 图解记忆:用真实任务找 Pareto 最优,再做路由与降级;点击图片可查看原图。
💡 答案要点
核心:选型不是"选最强",而是"任务复杂度 × 质量要求 × 成本预算"三维权衡。
三维决策框架(面试重点)
任务是什么?
├─ 简单问答/分类 → 便宜小模型(Flash/Lite 系列)
├─ 代码生成/复杂推理 → 中高端模型(Plus/Pro 系列)
└─ 超复杂推理/Agent长任务 → 旗舰(Max/Opus 系列)
质量要求多高?
├─ 内部工具/草稿 → 可接受小模型
└─ 对外生产/金融医疗 → 必须高端 + 人工复核
成本预算多少?
├─ 按量计费:看单价(输入/输出分别计费)
└─ 高并发:考虑缓存命中折扣(Prompt Caching)2026 年主流模型档位(按性价比分层,价格会变,看方法论)
| 档位 | 代表 | 特点 | 适用 |
|---|---|---|---|
| 超便宜档 | DeepSeek V4-Flash、Qwen Flash、Gemini Flash-Lite | 1-2元/百万输出 | 高频、量大、简单任务 |
| 性价比档 | Qwen Plus、DeepSeek V4-Pro、GLM | 4-8元/百万输出 | 通用生产任务 |
| 旗舰档 | GPT/Claude Opus/Qwen Max/Kimi | 30-100元/百万输出 | 复杂推理、高价值 |
| 推理档 | o3/R1/QwQ/DeepThink | 思考tokens另计 | 数学/代码/多步推理 |
选型五步法(面试必答)
- 先测基准:用你的真实任务在小样本上测几个候选模型(质量对比)
- 看成本结构:输入/输出单价 + 缓存命中价(高输入场景缓存价更关键)
- 算峰值需求:并发量 × 单次调用 token 数 × 单价 = 月成本预算
- 考虑峰谷:部分厂商高峰时段溢价(如 DeepSeek 白天 2 倍价),夜间批量任务可省一半
- 留 fallback:主模型 + 备用模型链(质量下降/限流时自动切换)
工程降本三板斧(加分项)
- 模型路由:简单问题走小模型,复杂问题升级大模型(省 60-90% 成本)
- Prompt Caching:静态前缀复用缓存,输入成本降 90%
- 批量/低峰调度:非实时任务放夜间跑(避开高峰溢价)
面试话术:
"选型我的方法论是'任务复杂度×质量×成本'三维权衡:先拿真实任务测候选模型的质量,再看单价和缓存价算成本,最后按峰值需求定预算。工程上我会配模型路由——简单问答走小模型(几分钱),复杂推理升级旗舰,再加 Prompt Caching 降输入成本。我现在的 Agent 系统就是 DeepSeek 主力 + Qwen 备用,夜间批量任务专门挑低峰时段跑,成本降了 70% 左右。"
