← 戻る

カテゴリ

LLM evaluation

Test prompts, models and agents against datasets, assertions and red-team probes, locally or in CI.

比較表

LLM evaluation
ツールスターライセンス利用条件セルフホスト言語最新リリース最終プッシュ
promptfoo26kMITオープンソース不可TypeScriptcode-scan-action-0.2.12026-10-06
DeepEval19kApache-2.0オープンソース不可Pythonpython-v4.2.42026-10-05
LM Evaluation Harness14kMITオープンソース不可Pythonv0.4.132026-09-14
garak9.5kApache-2.0オープンソース不可Pythonv0.17.02026-10-02
OpenCompass7.5kApache-2.0オープンソース不可Python0.5.42026-09-28
Giskard5.9kApache-2.0オープンソース不可Pythonv3.0.12026-10-06
Inspect2.9kMITオープンソース不可Python0.3.2762026-10-06

7件のツール

promptfoo

Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.

言語
TypeScript
ライセンス
MIT
スター
26k
最新リリース
code-scan-action-0.2.1
最終プッシュ
2026-10-06
OpenCompass

OpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100+ datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.

言語
Python
ライセンス
Apache-2.0
スター
7.5k
最新リリース
0.5.4
最終プッシュ
2026-09-28
Giskard

🐢 Open-Source Evaluation & Testing library for LLM Agents

言語
Python
ライセンス
Apache-2.0
スター
5.9k
最新リリース
v3.0.1
最終プッシュ
2026-10-06
Inspect

Inspect: A framework for large language model evaluations

言語
Python
ライセンス
MIT
スター
2.9k
最新リリース
0.3.276
最終プッシュ
2026-10-06

これらのツールが置き換えるもの