Training and validation data used for the M1-stage 500M-parameter
How Agentic research model.
pretrain/m1_pretrain_5b_clean_train.jsonl.gz: cleaned pretraining split.
pretrain/m1_pretrain_5b_clean_val.jsonl.gz: pretraining validation split.
pretrain/m1_pretrain_5b_clean_report.json: corpus construction and quality report.
pretrain/m1_pretrain_5b_clean_rejected_sample.jsonl.gz: a small sample of rejected records for auditing.… See the full description on the dataset page:
https://huggingface.co/datasets/jjyaoao/how-agentic-m1-research-data.