This dataset contains the evaluation results for various language models on the BIGGEN-Bench (BiG Generation Benchmark). It provides comprehensive performance assessments across multiple capabilities and tasks.
Key Features
Evaluation results for 103 language models
Scores across 9 different capabilities
Results from multiple evaluator models (GPT-4, Claude-3-Opus, Prometheus-2)… See the full description on the dataset page: https://huggingface.co/datasets/ch203/BiGGen-Bench-Results.