Skip to content
🔗 分享本题
查看我的学习进度 →

Prompt 压缩保留系统指令与引用证据并通过质量忠实度召回率回归评测图

🧠 记忆锚点:压缩要优先保留指令、约束和证据;节省多少取决于语料冗余度,必须通过质量回归后再上线。

💡 答案要点

LLMLingua 原理:

  • 用语义理解识别冗余内容
  • 保留核心信息,删除助词、重复描述
  • 压缩后文本依然通顺,LLM 能理解

压缩效果:

原始文本压缩后压缩率成本节省
5000 字500 字90%90%
2000 字400 字80%80%
1000 字300 字70%70%

使用示例:

python
from llmlingua import PromptCompressor

compressor = PromptCompressor(model_name="microsoft/llmlingua-2-7b-mini")

compressed = compressor.compress_prompt(
    context=retrieved_text,
    instruction=user_question,
    target_token=500  # 目标压缩到 500 token
)

# 调用 LLM
response = llm.generate(compressed['compressed_prompt'])

面试话术:

"我在 RAG 系统中集成了 LLMLingua,把检索回来的 5000 字参考资料压缩到 500 字,Token 成本降低 90%。关键是压缩后的文本语义完整,LLM 依然能准确回答问题。对于高频调用的场景,这个优化非常值得。"