Views
No views yet
HuggingFaceTB/SmolLM3-3B on the
AI-MO/NuminaMath-CoT dataset
(10K training samples).| Field | Value |
|---|---|
| Base model | HuggingFaceTB/SmolLM3-3B |
| Method | GRPO (RL) with LoRA/PEFT adapters |
| Dataset | AI-MO/NuminaMath-CoT |
| Training samples | 10K |
| Adapter | LoRA — load on top of the base model with PEFT |
1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base = AutoModelForCausalLM.from_pretrained("HuggingFaceTB/SmolLM3-3B", torch_dtype="auto", device_map="auto")
5model = PeftModel.from_pretrained(base, "ermiaazarkhalili/SmolLM3-3B-GRPO-NuminaMath-10K")
6tok = AutoTokenizer.from_pretrained("ermiaazarkhalili/SmolLM3-3B-GRPO-NuminaMath-10K")
7
8msgs = [{"role": "user", "content": "Solve: what is 17 * 24?"}]
9prompt = tok.apply_chat_template(msgs, tokenize=False, add_generation_prompt=True)
10out = model.generate(**tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=512)
11print(tok.decode(out[0], skip_special_tokens=True))ermiaazarkhalili/SmolLM3-3B-GRPO-NuminaMath-10K-GGUF.