← kembali

kategori

LLM evaluation

Test prompts, models and agents against datasets, assertions and red-team probes, locally or in CI.

Perbandingan berdampingan

LLM evaluation
AlatBintangLisensiKetentuanSelf-hostedBahasaTerbaruPush terakhir
promptfoo26kMITOpen sourceTidakTypeScriptcode-scan-action-0.2.12026-10-06
DeepEval19kApache-2.0Open sourceTidakPythonpython-v4.2.42026-10-05
LM Evaluation Harness14kMITOpen sourceTidakPythonv0.4.132026-09-14
garak9.5kApache-2.0Open sourceTidakPythonv0.17.02026-10-02
OpenCompass7.5kApache-2.0Open sourceTidakPython0.5.42026-09-28
Giskard5.9kApache-2.0Open sourceTidakPythonv3.0.12026-10-06
Inspect2.9kMITOpen sourceTidakPython0.3.2762026-10-06

7 alat

promptfoo

Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.

Bahasa
TypeScript
Lisensi
MIT
Bintang
26k
Terbaru
code-scan-action-0.2.1
Push terakhir
2026-10-06
OpenCompass

OpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100+ datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.

Bahasa
Python
Lisensi
Apache-2.0
Bintang
7.5k
Terbaru
0.5.4
Push terakhir
2026-09-28
Inspect

Inspect: A framework for large language model evaluations

Bahasa
Python
Lisensi
MIT
Bintang
2.9k
Terbaru
0.3.276
Push terakhir
2026-10-06

Apa yang digantikan alat-alat ini