The FineFineWeb Domain Evaluation dataset is a comprehensive multiple-choice question benchmark generated from the FineFineWeb corpus. It contains 33,081 high-quality reasoning questions across 67 different domains, designed specifically for evaluating language models' domain-specific reasoning capabilities. This is a test-focused dataset with 99.4% of data reserved for evaluation.… See the full description on the dataset page: https://huggingface.co/datasets/slm-scaling/finefineweb_domain_eval.