📑
PDF特化OCR — 複雑なレイアウト・表・数式をMarkdownに変換するツール
Marker、Docling、MinerU、Nougat、olmOCR — PDFをLLMが読める形に
通常OCRでPDFが不十分な理由
TesseractでPDFを処理するとテキストは出るが、多段レイアウトが混ざり、表のセル区分が消え、数式が壊れる。
PDF特化ツールはレイアウトを理解し正しい読み順でMarkdownを生成する。
ツール比較
| ツール | 特徴 | CJK | インストール |
|---|---|---|---|
| Marker | 汎用 | 対応 | pip install marker-pdf |
| Docling | エンタープライズ | 対応 | pip install docling |
| MinerU | CJK最強 | 最強 | uv pip install "mineru[all]" |
| Nougat | 学術論文 | 非対応 | pip install nougat-ocr |
キーコンセプト
1
Marker — pip install marker-pdf → marker_single doc.pdf でMarkdown変換
2
MinerU — CJK文書ならこれ。PaddleOCR内蔵で日中韓レイアウト最強
3
Nougat — 学術論文専用。数式をLaTeXに、参照を自動処理
4
Docling — RAGパイプラインに直接接続(LlamaIndex/LangChain)
ユースケース
RAG前処理 — PDFをMarkdownに変換→ベクトルDBにチャンキング・保存
論文分析 — 学術PDFから数式・表・参照を構造化テキストに
多言語文書 — CJKレイアウト(縦書き、ルビ等)のあるPDF処理