本数据集为NuminaMath-CoT在cn_k12类别下前20000条数据中进行的长CoT文本生成尝试。
里面有两个数据文件,completion.jsonl和distilled.jsonl。
其中,completion.jsonl是gemma2-27b-it生成的数据,因为gemma2-27b-it最后得到的结果可能提取不出\boxed{}里面的内容等因素,所以最后生成了约18.6k的数据。
而distilled.jsonl是基于上面的回答成功的问题,使用DeepSeek-R1-Distill-Qwen-32B生成的数据(其实不应该这样,之后有机会再从20000条里面直接生成)。
因为NuminaMath-CoT的cn_k12数据大多是一些综合应用题,一条数据中会有多个子问题,回答的时候也要分别回答。对问题回答的答案进行验证较难,尚未进行答案验证,需要下载下来之后再进行更精细化的处理。
completion.jsonl中的数据标签描述:
source (String):数据来源类别,为原始标签
problem (String):数学问题文本,为原始标签
solution… See the full description on the dataset page:
https://huggingface.co/datasets/tttonyyy/NuminaMath-CoT-cn_k12-20000-old.