Skip to content
🔗 分享本题
查看我的学习进度 →

什么是知识截止期?

每个LLM都有一个训练数据的截止日期。在这之后发生的事情,模型在预训练时根本没有接触过,因此它的"内部知识"中没有这些信息。

模型大致知识截止期
GPT-4 (初代)2021年
GPT-4 Turbo2023年初
Claude 3.5 Sonnet2024年
Llama 3.1 70B2023年
Qwen2.5 72B2024年2月
以各厂商最新公告为准动态更新

为什么它很重要?

  1. 直接影响回答准确性:问2025年之后的事件,模型要么编造(幻觉)要么说"我不知道"
  2. 系统设计关键决策:是否需要RAG联网搜索取决于你的用户会问什么时效性问题
  3. 用户预期管理:需要在产品层面告知用户模型的"知识范围"

工程解决方案

python
# 方案1:RAG检索增强(最常用)
def answer_with_rag(question):
    recent_docs = search_recent_knowledge_base(question)
    if recent_docs:
        return llm.generate(f"根据最新资料回答: {question}

参考资料:
{recent_docs}")
    else:
        return llm.generate(question)  # fallback to base model

三种处理策略

策略适用场景优点缺点
RAG联网搜索新闻、体育比分、股票价格实时性强延迟增加、检索质量依赖
定期重新训练/增量训练核心知识库持续更新知识深度好成本高、需要基础设施
诚实声明+降级无RAG能力的简单场景不会误导用户用户体验差

面试话术

"知识截止期是每个LLM产品的硬性约束。在我们的产品架构中,系统提示词会明确标注模型的知识范围,对时效性问题路由到RAG检索——优先查企业知识库,其次调用搜索引擎API。如果两者都没有相关内容,模型会明确说'这个问题超出了我的知识范围',而不是猜测。这种透明处理方式减少了70%以上的因信息过期导致的投诉。"