📋

タスク別評価チートシート — どの指標を使うべきか一目で

分類→Accuracy/F1、生成→BLEU/ROUGE、OCR→CER/WER、分離→SDR — コード付き

全部pip install evaluateで3行コード。

チートシート

タスク 主指標 良い水準 キー
分類 Accuracy, F1 85%+ accuracy, f1
翻訳 BLEU 0.3+ bleu
要約 ROUGE-L 0.4+ rouge
OCR CER 3%以下 cer
STT WER 10%以下 wer
音源分離 SDR 10+ dB mir_eval
テキスト生成 BERTScore 0.85+ bertscore

キーコンセプト

1

分類 → load("accuracy"), load("f1")

2

翻訳/要約 → load("bleu"), load("rouge")

3

OCR/STT → load("cer"), load("wer")

4

意味類似度 → load("bertscore")

5

音源分離 → mir_eval.separation.bss_eval_sources()

ユースケース

ファインチューニングモニタリング — Trainerのcompute_metricsでエポックごと自動評価 モデル選択 — 同じデータでTrOCR vs EasyOCR vs PaddleOCRのCER比較 プロダクション基準 — 「CER 3%以下、BLEU 0.4以上ならデプロイ」のような品質ゲート