这个数据集是基于DeepScalerR数据集采样20000条数据,使用QwQ-32B进行回答而收集到的。
在这个数据集中,文件末尾是_final.json的文件是经过过滤,只保留了回答正确数据的版本。
而末尾是.jsonl的文件是原始文件,里面包含了所有回答正确和错误的数据。
整个生成的正确性为:78.3%
重要的属性标签:
question:问题
gt_cot:原本数据集的回答
gt:原本的数字答案
pred_cot:模型的回答
pred_cot_token_len:模型回答的token长度
correct:模型回答的是否正确
message:(如果有)表示一个提问回答对,可以直接交给llama-factory微调