📋
タスク別評価チートシート — どの指標を使うべきか一目で
分類→Accuracy/F1、生成→BLEU/ROUGE、OCR→CER/WER、分離→SDR — コード付き
全部pip install evaluateで3行コード。
チートシート
| タスク | 主指標 | 良い水準 | キー |
|---|---|---|---|
| 分類 | Accuracy, F1 | 85%+ | accuracy, f1 |
| 翻訳 | BLEU | 0.3+ | bleu |
| 要約 | ROUGE-L | 0.4+ | rouge |
| OCR | CER | 3%以下 | cer |
| STT | WER | 10%以下 | wer |
| 音源分離 | SDR | 10+ dB | mir_eval |
| テキスト生成 | BERTScore | 0.85+ | bertscore |
キーコンセプト
1
分類 → load("accuracy"), load("f1")
2
翻訳/要約 → load("bleu"), load("rouge")
3
OCR/STT → load("cer"), load("wer")
4
意味類似度 → load("bertscore")
5
音源分離 → mir_eval.separation.bss_eval_sources()
ユースケース
ファインチューニングモニタリング — Trainerのcompute_metricsでエポックごと自動評価
モデル選択 — 同じデータでTrOCR vs EasyOCR vs PaddleOCRのCER比較
プロダクション基準 — 「CER 3%以下、BLEU 0.4以上ならデプロイ」のような品質ゲート