Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig
2from peft import PeftModel
3
4device = "cuda:0"
5
6quant_config = BitsAndBytesConfig(
7 load_in_4bit=True,
8 bnb_4bit_quant_type='nf4',
9 bnb_4bit_compute_dtype=torch.bfloat16,
10 bnb_4bit_use_double_quant=True,
11)
12
13## 1. Load the base model (we use llama3-8b-inst) with the given quantization config.
14base_model = AutoModelForCausalLM.from_pretrained(
15 "meta-llama/Meta-Llama-3-8B-Instruct",
16 quantization_config=quant_config,
17 device_map={"": device},
18)
19tokenizer = AutoTokenizer.from_pretrained("HOLILAB/td-llama-op")
20tokenizer.pad_token_id = tokenizer.eos_token_id
21
22## 2. Load the lora adapter with PeftModel
23model = PeftModel.from_pretrained(base_model, "HOLILAB/td-llama-op")
24