Views
No views yet
| Component | Details |
|---|---|
| Base Model | Qwen/Qwen3-1.7B |
| Algorithm | ExOPD (GRPO + Rollout Correction) |
| Dataset | zwhe99/DeepMath-103K |
| Filter | difficulty ≥ 6 (Olympiad level) |
| Samples | 8,000 problems |
| Teacher Model | Keven16/Qwen3-4B-Non-Thinking-RL-Math-Step500 |
| Epochs | 3 |
| Batch Size | 256 |
| Learning Rate | 1e-5 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("jindun/Qwen3-1.7B-GOPD-DeepMath", device_map="auto")
4tokenizer = AutoTokenizer.from_pretrained("jindun/Qwen3-1.7B-GOPD-DeepMath")