⚖️

契約書・法律文書特化OCR — 条項抽出、当事者識別、構造化

Legal-BERT + LayoutLMv3 + CUADデータセットで契約書を構造化データに変換

契約書処理パイプライン

ステップ1:OCR — 契約書画像/PDF→テキスト(PaddleOCR、Marker等)
ステップ2:NLU — テキスト→構造化データ(条項、当事者、期限、金額)

Legal-BERT

12GBの法律テキストで事前学習されたBERT。法律用語の理解に優れる。

CUADデータセット

500以上の実際の契約書、13,000の専門家アノテーション、41ラベルカテゴリ。

実践パイプライン

契約書PDF → Marker(テキスト)→ Legal-BERT + CUAD(条項分類)→ 構造化JSON

キーコンセプト

1

OCRで契約書テキスト抽出 — Marker/PaddleOCR等の一般ツールで十分

2

Legal-BERTで法律言語理解 — 12GB法律テキストで事前学習されたBERT

3

CUADデータセットでファインチューニング — 41条項カテゴリ分類学習

4

LayoutLMv3で文書構造理解 — テキスト+位置+画像を一緒に処理

ユースケース

契約書自動検討 — 解除条項、責任限度、競業禁止等の核心条項抽出 契約書比較 — 2つの契約書の条項差を自動比較 法律QA — 「この契約の解除条件は?」のような質問に自動回答