Skip to content
🔗 分享本题
查看我的学习进度 →

LLM 选型方法动漫知识图:用真实任务集比较候选模型的质量、P95 延迟、单位请求成本、稳定性与安全,寻找 Pareto 前沿并设计路由和降级

🧠 图解记忆:用真实任务找 Pareto 最优,再做路由与降级;点击图片可查看原图。

💡 答案要点

核心:选型不是"选最强",而是"任务复杂度 × 质量要求 × 成本预算"三维权衡。

三维决策框架(面试重点)

任务是什么?
  ├─ 简单问答/分类 → 便宜小模型(Flash/Lite 系列)
  ├─ 代码生成/复杂推理 → 中高端模型(Plus/Pro 系列)
  └─ 超复杂推理/Agent长任务 → 旗舰(Max/Opus 系列)

质量要求多高?
  ├─ 内部工具/草稿 → 可接受小模型
  └─ 对外生产/金融医疗 → 必须高端 + 人工复核

成本预算多少?
  ├─ 按量计费:看单价(输入/输出分别计费)
  └─ 高并发:考虑缓存命中折扣(Prompt Caching)

2026 年主流模型档位(按性价比分层,价格会变,看方法论)

档位代表特点适用
超便宜档DeepSeek V4-Flash、Qwen Flash、Gemini Flash-Lite1-2元/百万输出高频、量大、简单任务
性价比档Qwen Plus、DeepSeek V4-Pro、GLM4-8元/百万输出通用生产任务
旗舰档GPT/Claude Opus/Qwen Max/Kimi30-100元/百万输出复杂推理、高价值
推理档o3/R1/QwQ/DeepThink思考tokens另计数学/代码/多步推理

选型五步法(面试必答)

  1. 先测基准:用你的真实任务在小样本上测几个候选模型(质量对比)
  2. 看成本结构:输入/输出单价 + 缓存命中价(高输入场景缓存价更关键)
  3. 算峰值需求:并发量 × 单次调用 token 数 × 单价 = 月成本预算
  4. 考虑峰谷:部分厂商高峰时段溢价(如 DeepSeek 白天 2 倍价),夜间批量任务可省一半
  5. 留 fallback:主模型 + 备用模型链(质量下降/限流时自动切换)

工程降本三板斧(加分项)

  1. 模型路由:简单问题走小模型,复杂问题升级大模型(省 60-90% 成本)
  2. Prompt Caching:静态前缀复用缓存,输入成本降 90%
  3. 批量/低峰调度:非实时任务放夜间跑(避开高峰溢价)

面试话术:

"选型我的方法论是'任务复杂度×质量×成本'三维权衡:先拿真实任务测候选模型的质量,再看单价和缓存价算成本,最后按峰值需求定预算。工程上我会配模型路由——简单问答走小模型(几分钱),复杂推理升级旗舰,再加 Prompt Caching 降输入成本。我现在的 Agent 系统就是 DeepSeek 主力 + Qwen 备用,夜间批量任务专门挑低峰时段跑,成本降了 70% 左右。"