Views
No views yet
Qwen/Qwen3-0.6B, trained with GRPO (reinforcement learning) on AI-MO/NuminaMath-CoT.ermiaazarkhalili/Qwen3-0.6B-GRPO-NuminaMath-100K. See that repository for the full-precision weights.| Base model | Qwen/Qwen3-0.6B |
| Training data | AI-MO/NuminaMath-CoT |
| Method | LoRA GRPO (reinforcement learning) via Unsloth + TRL |
| License | apache-2.0 (inherited from the base model) |
| File | Size |
|---|---|
qwen3-0.6b-grpo-numinamath-100k.q4_k_m.gguf | 397 MB |
qwen3-0.6b-grpo-numinamath-100k.q5_k_m.gguf | 444 MB |
qwen3-0.6b-grpo-numinamath-100k.q8_0.gguf | 639 MB |
1huggingface-cli download ermiaazarkhalili/Qwen3-0.6B-GRPO-NuminaMath-100K-GGUF qwen3-0.6b-grpo-numinamath-100k.q4_k_m.gguf --local-dir .
2llama-cli -m qwen3-0.6b-grpo-numinamath-100k.q4_k_m.gguf -p "Explain gradient checkpointing in two sentences." -n 2561echo 'FROM ./qwen3-0.6b-grpo-numinamath-100k.q4_k_m.gguf' > Modelfile
2ollama create qwen3-0.6b-grpo-numinamath-100k-gguf -f Modelfile
3ollama run qwen3-0.6b-grpo-numinamath-100k-ggufscripts/generate_hub_model_card.py.