A comprehensive G-Eval (Liu et al., EMNLP 2023) benchmark of 16 small language models under 2B parameters, covering 6 dimensions across 33 test items.
Judge model: DeepSeek-v4-pro
summary.csv
One-row-per-model score… See the full description on the dataset page:
https://huggingface.co/datasets/aaaaaaapluto/1b-model-eval.