Views
No views yet
| Field | Value |
|---|---|
| Base model | Qwen/Qwen2.5-3B-Instruct |
| Method | OPD initialization followed by GRPO |
| Teacher | Qwen/Qwen2.5-Coder-7B-Instruct during OPD |
| Released checkpoint | GRPO step 98 (2 epochs) |
| Training data | OPD split followed by 1,582 mutation-eligible Defects4J samples |
| Prompt format | Qwen2.5 chat template |
| Global training seed | 42 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "tomhu/RL4TG-Qwen2.5-3B-OPD-GRPO-2-Epochs"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForCausalLM.from_pretrained(
6 model_id,
7 torch_dtype="auto",
8 device_map="auto",
9)main revision is the final step-98 model.| Revision | Training step | Load argument |
|---|---|---|
step-10 | 10 | revision="step-10" |
step-20 | 20 | revision="step-20" |
step-30 | 30 | revision="step-30" |
step-40 | 40 | revision="step-40" |
step-50 | 50 | revision="step-50" |
step-60 | 60 | revision="step-60" |
step-70 | 70 | revision="step-70" |
step-80 | 80 | revision="step-80" |
step-90 | 90 | revision="step-90" |