Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5base_model = AutoModelForCausalLM.from_pretrained(
6 "Qwen/Qwen2.5-0.5B-Instruct", dtype=torch.float32
7)
8tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-0.5B-Instruct")
9model = PeftModel.from_pretrained(base_model, "salik702/qwen2.5-0.5b-codealpaca-lora")
10
11prompt = "### Instruction:\nWrite a Python function to check if a number is prime\n\n### Response:\n"
12inputs = tokenizer(prompt, return_tensors="pt")
13outputs = model.generate(**inputs, max_new_tokens=150)
14print(tokenizer.decode(outputs[0], skip_special_tokens=True))transformers + peft on a CPU-only machine, using a custom training script with LoRA adapters applied to attention projection layers.