Skip to content
🔗 分享本题
查看我的学习进度 →

背景: 扫描版 PDF,包含大量跨页表格,直接 OCR 导致文字逻辑错乱。

解决方案:

  1. 布局分析(Layout Analysis)

    • 用 Layout-Parser 或 PaddleOCR 的区域检测模型
    • 先识别出文档中的"表格区"、"正文区"
  2. 多模态增强

    • 针对极难处理的表格,用 GPT-4o 直接截取图像进行转换
  3. 管道化清洗(Pipeline)

    • 先用 PyMuPDF 提取可复制文字
    • 对无法识别的图片层启动 OCR
    • 最后通过 Cleaner LLM 修复噪点

结果: 财务指标提取准确率从 65% 提升到 94%