Views
No views yet
Qwen/Qwen3-1.7B-Base (base revision ea980cb0a6c2ae4b936e82123acc929f1cec04c1).| Experiment | Repository subfolder | Steps |
|---|---|---|
| AGRO SeqSum, beta=0.001 | agro-seqsum-beta0.001/step-{N} | 100 |
| GCPO Exp SeqMean, beta=0.001 | gcpo-exp-seqmean-beta0.001/step-{N} | 360, 500 |
| GCPO Exp SeqMean, beta=0.01 | gcpo-exp-seqmean-beta0.01/step-{N} | 340, 500 |
| GCPO Exp SeqMean, beta=0.1 | gcpo-exp-seqmean-beta0.1/step-{N} | 500 |
| GCPO Exp SeqMean, beta=1 | gcpo-exp-seqmean-beta1/step-{N} | 500 |
| GCPO Exp SeqMean, beta=1, plain shuffle | gcpo-exp-seqmean-beta1-plain-shuffle/step-{N} | 440, 500 |
| GRPO, KL=0.001 | grpo-kl0.001/step-{N} | 420, 500 |
| Matched DAPO | matched-dapo/step-{N} | 220, 300 |
| Matched DAPO + Token-TIS | matched-dapo-tis/step-{N} | 220, 300 |
model.safetensors, model configuration, and tokenizer files.1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3repo_id = "Thunderous77/grpo"
4subfolder = "gcpo-exp-seqmean-beta1-plain-shuffle/step-500"
5
6tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder)
7model = AutoModelForCausalLM.from_pretrained(
8 repo_id,
9 subfolder=subfolder,
10 dtype="auto",
11 device_map="auto",
12)model.safetensors was then verified against its local SHA-256 digest.