Views
No views yet
| Weight | Reward | Correct | Hallucination | Refusal |
|---|---|---|---|---|
| 0.40 | R₁ Correctness | +1.5 | -1.0 | None |
| 0.25 | R₂ Logic Density | 0→1.0 | -0.3 | -0.5 |
| 0.30 | R₃ Refusal Calibration | +1.0 | -2.5 | 0.0 |
| 0.05 | R₄ Length Penalty | 0.0 | 0.0 | 0.0 |
1pip install trl transformers torch datasets accelerate trackio
2MODEL_ID=Qwen/Qwen2.5-3B-Instruct accelerate launch sovereign_grpo_train.py