Pristine is a dataset of 500k prompts/reasoning traces/responses for SFT. It contains responses from GPT-OSS-120B and 20B with a variety of reasoning efforts. For math and code domains, it uses high reasoning effort. For chat domain it uses low / medium reasoning efforts.
Dataset Sources:
qingy2024/GPT-OS3-Dataset-v2
xl-zhao/PromptCoT-2.0-SFT-4.8M