Views
No views yet
pip install -U transformers datasets peft bitsandbytes accelerate1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
3
4model_name = "meta-llama/Llama-3.2-1B"
5
6bnb_config = BitsAndBytesConfig(
7 load_in_4bit=True,
8 bnb_4bit_quant_type="nf4",
9 bnb_4bit_compute_dtype=torch.bfloat16,
10 bnb_4bit_use_double_quant=True,
11)
12
13tokenizer = AutoTokenizer.from_pretrained(model_name)
14
15model = AutoModelForCausalLM.from_pretrained(
16 model_name,
17 quantization_config=bnb_config,
18 dtype=torch.bfloat16,
19 device_map="auto"
20)
21
22print("🔥 Base Model Loaded in 4-bit Mode")1from peft import PeftModel
2
3lora_model = PeftModel.from_pretrained(model, "omkarwazulkar/LLama3.2-1B-QLoRA")
4lora_model.eval()
5
6print("🟥 LoRA Adapter Attached Successfully")1def generate(prompt):
2 inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
3 output = lora_model.generate(
4 **inputs,
5 max_new_tokens=200,
6 temperature=0.7,
7 top_p=0.9,
8 pad_token_id=tokenizer.eos_token_id
9 )
10 return tokenizer.decode(output[0], skip_special_tokens=True)
11
12print(generate("Explain quantum computing simply."))1from datasets import load_dataset
2
3dataset = load_dataset("tatsu-lab/alpaca", split="train")
4
5for i in range(n):
6 ex = dataset[i]
7 prompt = f"Instruction: {ex['instruction']}\n\nAnswer:" if ex['input']=="" else \
8 f"Instruction: {ex['instruction']}\nInput: {ex['input']}\n\nAnswer:"
9
10 print(f"===== SAMPLE {i} =====")
11 print(generate(prompt))
12 print("=======================")
13