🧠 图解记忆: 先减少输入,再选择模型,最后优化调度;省成本不能牺牲关键视觉信息。
💡 答案要点
性能优化:
| 策略 | 说明 | 效果 |
|---|---|---|
| 图片压缩 | 降低分辨率,保持关键信息 | 延迟降低 50% |
| 图片裁剪 | 只保留相关区域 | Token 减少 70% |
| 缓存机制 | 相同图片不重复处理 | 成本降低 40% |
| 异步处理 | 非实时场景异步执行 | 用户体验提升 |
成本优化:
| 策略 | 说明 | 节省比例 |
|---|---|---|
| 模型路由 | 简单图片用小模型 | 30-50% |
| 预处理 | 先用 CV 模型提取信息 | 40-60% |
| 混合方案 | OCR+LLM 结合 | 50-70% |
实现示例:
python
# 图片预处理:先用 CV 模型检测是否有文字
def has_text(image):
result = ocr_model.detect(image)
return len(result) > 0
# 根据情况选择模型
if has_text(image):
# 有文字,用 OCR+LLM
text = ocr_model.extract(image)
response = llm.generate(text)
else:
# 无文字,用多模态模型
response = gpt4v.generate(image, prompt)面试话术:
示例表达(仅在能用本人经历或可复现实验佐证时使用): "我设计了混合方案:先用轻量级 OCR 模型检测图片是否有文字,有文字就用 OCR+LLM,没有就用多模态模型。这样成本降低了 60%,响应速度提升了 2 倍。"
