⚖️
契約書・法律文書特化OCR — 条項抽出、当事者識別、構造化
Legal-BERT + LayoutLMv3 + CUADデータセットで契約書を構造化データに変換
契約書処理パイプライン
ステップ1:OCR — 契約書画像/PDF→テキスト(PaddleOCR、Marker等)
ステップ2:NLU — テキスト→構造化データ(条項、当事者、期限、金額)
Legal-BERT
12GBの法律テキストで事前学習されたBERT。法律用語の理解に優れる。
CUADデータセット
500以上の実際の契約書、13,000の専門家アノテーション、41ラベルカテゴリ。
実践パイプライン
契約書PDF → Marker(テキスト)→ Legal-BERT + CUAD(条項分類)→ 構造化JSON
キーコンセプト
1
OCRで契約書テキスト抽出 — Marker/PaddleOCR等の一般ツールで十分
2
Legal-BERTで法律言語理解 — 12GB法律テキストで事前学習されたBERT
3
CUADデータセットでファインチューニング — 41条項カテゴリ分類学習
4
LayoutLMv3で文書構造理解 — テキスト+位置+画像を一緒に処理
ユースケース
契約書自動検討 — 解除条項、責任限度、競業禁止等の核心条項抽出
契約書比較 — 2つの契約書の条項差を自動比較
法律QA — 「この契約の解除条件は?」のような質問に自動回答