This evaluation dataset was created as part of the simple_test__exp_runner_2 experiment using the SkillFactory experiment management system.
{"model": "Qwen/Qwen2.5-1.5b-Instruct", "tasks": ["countdown_2arg", "countdown_3arg"], "annotators": ["greedy"], "splits": ["test"], "dataset_url":… See the full description on the dataset page:
https://huggingface.co/datasets/TAUR-dev/D-EVAL__standard_eval_v3__simple_test__exp_runner_2-eval_0.