背景: 扫描版 PDF,包含大量跨页表格,直接 OCR 导致文字逻辑错乱。
解决方案:
布局分析(Layout Analysis)
- 用 Layout-Parser 或 PaddleOCR 的区域检测模型
- 先识别出文档中的"表格区"、"正文区"
多模态增强
- 针对极难处理的表格,用 GPT-4o 直接截取图像进行转换
管道化清洗(Pipeline)
- 先用 PyMuPDF 提取可复制文字
- 对无法识别的图片层启动 OCR
- 最后通过 Cleaner LLM 修复噪点
结果: 财务指标提取准确率从 65% 提升到 94%