HELM

EvaluationBenchmark

Holistic Evaluation of Language Models. Evaluates LLMs across 42 scenarios and 7 metrics for a complete capability picture.

Visit website View on GitHub
Built with
PythonStanford
Share this part