Skip to content
🔗 分享本题
查看我的学习进度 →

模型路由按任务、复杂度、模态、SLA 和预算先过滤硬约束再优化质量成本延迟图

🧠 记忆锚点:先用质量、合规、SLA 等硬约束筛掉不可用模型,再在可行集合中优化成本与延迟,并准备降级兜底。

💡 答案要点

路由策略:

用户问题 → 意图分类 → 选择模型 → 调用 → 返回答案

        ┌───────────┼───────────┐
        ↓           ↓           ↓
    简单问题    中等问题     复杂问题
   (GPT-4o-mini) (Claude)   (GPT-4)

分类维度:

维度简单中等复杂
问题类型打招呼、常识一般问答复杂推理、代码
Token 预算< 500500-2000> 2000
延迟要求< 1s1-3s> 3s
推荐模型GPT-4o-miniClaude/GeminiGPT-4

实现示例:

python
class ModelRouter:
    def __init__(self):
        self.classifier = load_classifier()  # BERT 或 GPT-4o-mini

    def route(self, question):
        # 意图分类
        intent = self.classifier.predict(question)

        if intent == "simple":
            return "qwen3.5-flash"
        elif intent == "medium":
            return "claude-3-sonnet"
        else:
            return "qwen3.5-plus"

面试话术:

示例表达(仅在能用本人经历或可复现实验佐证时使用): "我设计的路由系统把问题分成三档,简单问题用便宜模型(GPT-4o-mini),复杂问题用 GPT-4。分类器本身用轻量级 BERT,成本几乎可以忽略。上线后成本降低了 35%,用户体验没有明显下降。"

📚 参考:LiteLLM(多模型路由与代理)