Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
2from peft import PeftModel
3
4# Load base model with quantization
5quantization_config = BitsAndBytesConfig(
6 load_in_4bit=True,
7 bnb_4bit_compute_dtype=torch.float16,
8 bnb_4bit_use_double_quant=True,
9 bnb_4bit_quant_type="nf4"
10)
11
12model = AutoModelForCausalLM.from_pretrained(
13 "Qwen/Qwen3-0.6B",
14 quantization_config=quantization_config,
15 device_map="auto"
16)
17
18# Load LoRA adapter
19model = PeftModel.from_pretrained(model, "codelion/Qwen3-0.6B-accuracy-recovery-lora")
20
21# Load tokenizer
22tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3-0.6B")
23
24# Use the model
25inputs = tokenizer("Hello, how are you?", return_tensors="pt")
26outputs = model.generate(**inputs, max_new_tokens=100)
27response = tokenizer.decode(outputs[0], skip_special_tokens=True)
28print(response)