This is a pairwise comparison dataset created from SWE-bench evaluation results.
Qwen3-32B_16episodes_comparisons_full_comparison_pairs.jsonl: JSONL file containing comparison pairs
{
"dataset_name": "Qwen3-32B_16episodes_comparisons_full",
"model_name": "Qwen3-32B",
"num_episodes": 16,
"episodes_used": [
1,
2,
3,
4,
5,
6,
7,
8,
9,
10,
11,
12,
13… See the full description on the dataset page:
https://huggingface.co/datasets/helloelwin/Qwen3-32B_16episodes_comparisons_full.