
🧠 记忆锚点:先用质量、合规、SLA 等硬约束筛掉不可用模型,再在可行集合中优化成本与延迟,并准备降级兜底。
💡 答案要点
路由策略:
用户问题 → 意图分类 → 选择模型 → 调用 → 返回答案
↓
┌───────────┼───────────┐
↓ ↓ ↓
简单问题 中等问题 复杂问题
(GPT-4o-mini) (Claude) (GPT-4)分类维度:
| 维度 | 简单 | 中等 | 复杂 |
|---|---|---|---|
| 问题类型 | 打招呼、常识 | 一般问答 | 复杂推理、代码 |
| Token 预算 | < 500 | 500-2000 | > 2000 |
| 延迟要求 | < 1s | 1-3s | > 3s |
| 推荐模型 | GPT-4o-mini | Claude/Gemini | GPT-4 |
实现示例:
python
class ModelRouter:
def __init__(self):
self.classifier = load_classifier() # BERT 或 GPT-4o-mini
def route(self, question):
# 意图分类
intent = self.classifier.predict(question)
if intent == "simple":
return "qwen3.5-flash"
elif intent == "medium":
return "claude-3-sonnet"
else:
return "qwen3.5-plus"面试话术:
示例表达(仅在能用本人经历或可复现实验佐证时使用): "我设计的路由系统把问题分成三档,简单问题用便宜模型(GPT-4o-mini),复杂问题用 GPT-4。分类器本身用轻量级 BERT,成本几乎可以忽略。上线后成本降低了 35%,用户体验没有明显下降。"
📚 参考:LiteLLM(多模型路由与代理)