Views
No views yet
set_name, set_description, add_skill, write_prompt,
set_model, submit.| Metric | Value |
|---|---|
| Success rate | 80% (8/10 eval rollouts) |
| Mean reward | +7.68 |
| Base model | Qwen3-1.7B, 4-bit LoRA via Unsloth |
| Algorithm | GRPO with DAPO loss |
| Hardware | Google Colab T4 |