Views
No views yet
two_body_problem.| Field | Value |
|---|---|
| Base model | Qwen/Qwen2.5-3B-Instruct |
| Fine-tuning method | GRPO + evolving skill bank |
| Level | two_body_problem |
| Training seeds | 1–50 |
| Val seeds | 51–100 |
| Checkpoint | global_step_50 (epoch 1) |
| Batch size | 1 seed / step |
| Rollouts per step | n=4 |
| Learning rate | 1 × 10⁻⁶ |
| Max turns per episode | 25 |
| Hardware | 1 × A100 80 GB |
| Reward | Binary {0, 1} — environment success predicate |
| Observation masking | Yes (mask_observations=True) |
1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("vgandhi13/Qwen2.5-3B-Interphyre-Evolving-TwoBodyProblem")
4model = AutoModelForCausalLM.from_pretrained("vgandhi13/Qwen2.5-3B-Interphyre-Evolving-TwoBodyProblem", device_map="auto")