PDF 处理链别一上来就 OCR:pdf-inspector 如何先用本地解析完成分类、路由与 Markdown 抽取
pdf-inspector 用 Rust 核心完成 PDF 分类、置信度判断、逐页 OCR 路由和 Markdown 抽取,让 TextBased 与 Mixed 文档先走本地解析,扫描页再交给后续 OCR。
3 min
共 3 篇文章
pdf-inspector 用 Rust 核心完成 PDF 分类、置信度判断、逐页 OCR 路由和 Markdown 抽取,让 TextBased 与 Mixed 文档先走本地解析,扫描页再交给后续 OCR。
从长文档解析、分页上下文、布局保留和部署验证角度评估 Baidu Unlimited-OCR:它的亮点不是“万能 OCR”,而是把多页文档尽量放进一次连续解析里。
MinerU 可把复杂 PDF、Office 和图片文档转为 Markdown/JSON,但在 RAG 场景中更适合被设计成带评测、溯源、重试与人工复核的文档入库质量闸门。