Views
No views yet
1
2base_model_id = "NousResearch/Meta-Llama-3-8B"
3new_model_id = "dasanindya15/llama3-8b_qlora_Cladder_v1"
4
5import torch
6from transformers import AutoModelForCausalLM, AutoTokenizer, pipeline
7from peft import PeftModel
8from transformers import BitsAndBytesConfig
9
10# Load the entire model on the GPU 0
11device_map = {"": 0}
12
13# Reload model in FP16 and merge it with LoRA weights
14# specify the quantize the model
15quantization_config = BitsAndBytesConfig(
16 load_in_4bit=True,
17 bnb_4bit_use_double_quant=True,
18 bnb_4bit_quant_type="nf4",
19 bnb_4bit_compute_dtype=torch.bfloat16,
20)
21base_model = AutoModelForCausalLM.from_pretrained(base_model_id,
22 quantization_config=quantization_config,
23 device_map=device_map)
24model = PeftModel.from_pretrained(base_model, new_model_id)
25
26# Reload tokenizer to save it
27tokenizer = AutoTokenizer.from_pretrained(base_model_id, trust_remote_code=True)
28tokenizer.pad_token = tokenizer.eos_token
29tokenizer.padding_side = "right"
30
31