🧪
AI評価ツールカタログ — evaluate、lm-eval-harness、RAGAS、DeepEval
単一指標測定からLLMベンチマーク、RAG評価、自動テストパイプラインまで
用途別に違うツール
| ツール | 用途 | 例え |
|---|---|---|
| evaluate | 単一指標 | 体温計 |
| lm-eval-harness | LLMベンチマーク | 総合健康診断 |
| RAGAS | RAGパイプライン | 専門検査 |
| DeepEval | AIアプリテスト | CI/CDテスト |
選択ガイド
| 状況 | ツール |
|---|---|
| ファインチューニング中の精度追跡 | evaluate |
| 自分のLLMは何点? | lm-eval-harness |
| RAGパイプライン品質 | RAGAS |
| AIアプリ自動テスト(CI/CD) | DeepEval |
キーコンセプト
1
evaluate — pip install evaluate。指標1つ測定。Trainerに入れて使用
2
lm-eval-harness — pip install lm-eval。LLMを数十のベンチマークで総合評価
3
RAGAS — pip install ragas。RAGの検索品質+回答品質を同時評価
4
DeepEval — pip install deepeval。pytestのようにAI出力を自動テスト
ユースケース
ファインチューニング品質管理 — evaluateでエポックごとに正解率/CER追跡
LLMリーダーボード — lm-eval-harnessでMMLU/HellaSwagスコア測定
RAGチャットボット検証 — RAGASでハルシネーション率、検索精度、回答関連性を測定