📑

PDF特化OCR — 複雑なレイアウト・表・数式をMarkdownに変換するツール

Marker、Docling、MinerU、Nougat、olmOCR — PDFをLLMが読める形に

通常OCRでPDFが不十分な理由

TesseractでPDFを処理するとテキストは出るが、多段レイアウトが混ざり、表のセル区分が消え、数式が壊れる。

PDF特化ツールはレイアウトを理解し正しい読み順でMarkdownを生成する。

ツール比較

ツール 特徴 CJK インストール
Marker 汎用 対応 pip install marker-pdf
Docling エンタープライズ 対応 pip install docling
MinerU CJK最強 最強 uv pip install "mineru[all]"
Nougat 学術論文 非対応 pip install nougat-ocr

キーコンセプト

1

Marker — pip install marker-pdf → marker_single doc.pdf でMarkdown変換

2

MinerU — CJK文書ならこれ。PaddleOCR内蔵で日中韓レイアウト最強

3

Nougat — 学術論文専用。数式をLaTeXに、参照を自動処理

4

Docling — RAGパイプラインに直接接続(LlamaIndex/LangChain)

ユースケース

RAG前処理 — PDFをMarkdownに変換→ベクトルDBにチャンキング・保存 論文分析 — 学術PDFから数式・表・参照を構造化テキストに 多言語文書 — CJKレイアウト(縦書き、ルビ等)のあるPDF処理