Skip to content
🔗 分享本题
查看我的学习进度 →

25 模块 Q7 教学图:设计一个大规模企业文档摄取与索引平台

🧠 图解记忆:将上传、病毒扫描、解析/OCR、标准化、分块、Embedding、索引和质量校验拆成可重试阶段;点击图片可查看原图。

💡 答案要点

将上传、病毒扫描、解析/OCR、标准化、分块、Embedding、索引和质量校验拆成可重试阶段。每个阶段以 tenant_id + document_id + version + stage 作为幂等键,原文、解析结果和索引版本分开保存。

更新时使用新版本旁路构建,校验文档数、chunk 数、权限和抽样检索后再原子切换 alias;删除需要传播到原文、倒排、向量和缓存。失败进入死信队列,支持从最近成功阶段续跑,并监控积压、解析失败率、索引新鲜度和孤儿 chunk。

📚 参考:LlamaIndex:Data Ingestion Pipeline(文档摄取参考)