Views
No views yet
HuggingFaceTB/SmolLM3-3B, trained with GRPO (reinforcement learning) on AI-MO/NuminaMath-CoT.ermiaazarkhalili/SmolLM3-3B-GRPO-NuminaMath-10K. See that repository for the full-precision weights.| Base model | HuggingFaceTB/SmolLM3-3B |
| Training data | AI-MO/NuminaMath-CoT |
| Method | LoRA GRPO (reinforcement learning) via Unsloth + TRL |
| License | apache-2.0 (inherited from the base model) |
| File | Size |
|---|---|
smollm3-3b-grpo-numinamath-10k.q4_k_m.gguf | 1.92 GB |
smollm3-3b-grpo-numinamath-10k.q5_k_m.gguf | 2.21 GB |
smollm3-3b-grpo-numinamath-10k.q8_0.gguf | 3.28 GB |
1huggingface-cli download ermiaazarkhalili/SmolLM3-3B-GRPO-NuminaMath-10K-GGUF smollm3-3b-grpo-numinamath-10k.q4_k_m.gguf --local-dir .
2llama-cli -m smollm3-3b-grpo-numinamath-10k.q4_k_m.gguf -p "Explain gradient checkpointing in two sentences." -n 2561echo 'FROM ./smollm3-3b-grpo-numinamath-10k.q4_k_m.gguf' > Modelfile
2ollama create smollm3-3b-grpo-numinamath-10k-gguf -f Modelfile
3ollama run smollm3-3b-grpo-numinamath-10k-ggufscripts/generate_hub_model_card.py.