Views
No views yet
| Stage | Directory | LoRA Rank | Steps | Notes |
|---|---|---|---|---|
| SFT | sft/ | 32 | 1000 | Supervised fine-tune on IRC sections |
| DPO | dpo/ | 16 | 500 | Direct preference optimization; init from SFT |
| GRPO | grpo/ | 32 | 300 | Group relative policy optimization; init from DPO |
1pip install mlx-lm
2
3# Generate with GRPO adapter (best quality):
4mlx_lm.generate \
5 --model Qwen/Qwen2.5-3B-Instruct \
6 --adapter-path grpo/ \
7 --prompt "What is the standard deduction for 2024?"