🧪

AI評価ツールカタログ — evaluate、lm-eval-harness、RAGAS、DeepEval

単一指標測定からLLMベンチマーク、RAG評価、自動テストパイプラインまで

用途別に違うツール

ツール 用途 例え
evaluate 単一指標 体温計
lm-eval-harness LLMベンチマーク 総合健康診断
RAGAS RAGパイプライン 専門検査
DeepEval AIアプリテスト CI/CDテスト

選択ガイド

状況 ツール
ファインチューニング中の精度追跡 evaluate
自分のLLMは何点? lm-eval-harness
RAGパイプライン品質 RAGAS
AIアプリ自動テスト(CI/CD) DeepEval

キーコンセプト

1

evaluate — pip install evaluate。指標1つ測定。Trainerに入れて使用

2

lm-eval-harness — pip install lm-eval。LLMを数十のベンチマークで総合評価

3

RAGAS — pip install ragas。RAGの検索品質+回答品質を同時評価

4

DeepEval — pip install deepeval。pytestのようにAI出力を自動テスト

ユースケース

ファインチューニング品質管理 — evaluateでエポックごとに正解率/CER追跡 LLMリーダーボード — lm-eval-harnessでMMLU/HellaSwagスコア測定 RAGチャットボット検証 — RAGASでハルシネーション率、検索精度、回答関連性を測定