Difficulty-balanced arithmetic dataset (addition, subtraction, multiplication,
division) for evaluating and fine-tuning language models. Problems are classified
into four difficulty tiers (easy, medium_easy, medium_hard, hard) based on
Qwen2.5-0.5B-Instruct performance. Includes 10k training samples, 200
validation, and 400 test (in-domain + out-of-domain phrasings).
default
train
10,000
training set… See the full description on the dataset page:
https://huggingface.co/datasets/ChrisMcCormick/basic-arithmetic.