🧠 图解记忆:上下文窗口同时装输入和输出,超限要裁剪、压缩或检索;点击图片可查看原图。
定义: LLM 一次能处理的总 token 数(输入 + 输出)。
| 模型 | 上下文限制 |
|---|---|
| API 模型 | 以供应商当前模型文档为准 |
| 自部署模型 | 同时受模型训练长度、位置编码扩展方法和推理引擎配置影响 |
超出限制的解决方案
- 截断 - 保留最近的对话
- 总结 - 用 LLM 总结历史对话
- 滑动窗口 - 只保留最近 N 轮
- 向量检索 - 把历史存向量库,按需检索
- 分层摘要 - 重要信息摘要 + 最近对话原文
🧠 图解记忆:上下文窗口同时装输入和输出,超限要裁剪、压缩或检索;点击图片可查看原图。
定义: LLM 一次能处理的总 token 数(输入 + 输出)。
| 模型 | 上下文限制 |
|---|---|
| API 模型 | 以供应商当前模型文档为准 |
| 自部署模型 | 同时受模型训练长度、位置编码扩展方法和推理引擎配置影响 |