Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3
4# Load base model and tokenizer
5tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3-0.6B")
6base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-0.6B")
7
8# Load LoRA adapter
9model = PeftModel.from_pretrained(base_model, "your-username/qwen3-gsm8k-lora")
10
11# Generate response
12question = "Tom has 12 apples. He ate 5. How many are left?"
13messages = [{"role": "user", "content": question}]
14text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
15inputs = tokenizer([text], return_tensors="pt")
16
17outputs = model.generate(**inputs, max_new_tokens=200)
18response = tokenizer.decode(outputs[0][len(inputs.input_ids[0]):], skip_special_tokens=True)
19print(response)