Views
No views yet
harshbhatt7585/arithmetic-king-1b.<reasoning>...</reasoning><answer>...</answer>meta-llama/Llama-3.2-1B-InstructGRPOTrainer1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3
4base_id = "meta-llama/Llama-3.2-1B-Instruct"
5adapter_id = "harshbhatt7585/arithmetic-king-1b"
6
7tokenizer = AutoTokenizer.from_pretrained(base_id)
8base_model = AutoModelForCausalLM.from_pretrained(base_id)
9model = PeftModel.from_pretrained(base_model, adapter_id)
10
11prompt = "Solve: (12 + 3) * 2. Return XML with <reasoning> and <answer>."
12inputs = tokenizer(prompt, return_tensors="pt")
13out = model.generate(**inputs, max_new_tokens=128)
14print(tokenizer.decode(out[0], skip_special_tokens=True))meta-llama/Llama-3.2-1B-Instruct