
🧠 记忆锚点:压缩要优先保留指令、约束和证据;节省多少取决于语料冗余度,必须通过质量回归后再上线。
💡 答案要点
LLMLingua 原理:
- 用语义理解识别冗余内容
- 保留核心信息,删除助词、重复描述
- 压缩后文本依然通顺,LLM 能理解
压缩效果:
| 原始文本 | 压缩后 | 压缩率 | 成本节省 |
|---|---|---|---|
| 5000 字 | 500 字 | 90% | 90% |
| 2000 字 | 400 字 | 80% | 80% |
| 1000 字 | 300 字 | 70% | 70% |
使用示例:
python
from llmlingua import PromptCompressor
compressor = PromptCompressor(model_name="microsoft/llmlingua-2-7b-mini")
compressed = compressor.compress_prompt(
context=retrieved_text,
instruction=user_question,
target_token=500 # 目标压缩到 500 token
)
# 调用 LLM
response = llm.generate(compressed['compressed_prompt'])面试话术:
"我在 RAG 系统中集成了 LLMLingua,把检索回来的 5000 字参考资料压缩到 500 字,Token 成本降低 90%。关键是压缩后的文本语义完整,LLM 依然能准确回答问题。对于高频调用的场景,这个优化非常值得。"