Views
No views yet
Qwen/Qwen2.5-1.5B-InstructGRPOTrainer + Unsloth on OpenEnv OrbitalThrusterEnv flagship task mission_ops_long_horizon.
5 independent reward funcs (format, env-step, mode-match, anti-spam, fuel-discipline) for anti-reward-hacking.trainer_output/qwen_grpo/ — final LoRA adaptertrainer_output/qwen_sft/ — SFT warm-start adapteroutputs/training/grpo_metrics.png — reward + loss curvesoutputs/eval_trained/trained_vs_baseline.png — trained vs baselines on 4 tasks