Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4# Load base model
5base_model = AutoModelForCausalLM.from_pretrained(
6 "meta-llama/Llama-3.1-8B-Instruct",
7 device_map="auto",
8 torch_dtype="auto"
9)
10
11# Load LoRA adapter
12model = PeftModel.from_pretrained(base_model, "alantandrea/wiff-expert-llama3.1-8b-lora")
13tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-3.1-8B-Instruct")
14
15# Generate
16prompt = "Your question here"
17inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
18outputs = model.generate(**inputs, max_new_tokens=256)
19print(tokenizer.decode(outputs[0], skip_special_tokens=True))1from transformers import AutoModelForCausalLM, BitsAndBytesConfig
2import torch
3
4# 4-bit quantization for ~6GB VRAM
5bnb_config = BitsAndBytesConfig(
6 load_in_4bit=True,
7 bnb_4bit_compute_dtype=torch.float16
8)
9
10base_model = AutoModelForCausalLM.from_pretrained(
11 "meta-llama/Llama-3.1-8B-Instruct",
12 quantization_config=bnb_config,
13 device_map="auto"
14)
15
16model = PeftModel.from_pretrained(base_model, "alantandrea/wiff-expert-llama3.1-8b-lora")