Views
No views yet
1
2import os
3import pandas as pd
4import torch
5from datasets import load_dataset, Dataset
6from transformers import (
7 AutoModelForCausalLM,
8 AutoTokenizer,
9 BitsAndBytesConfig,
10 HfArgumentParser,
11)
12from peft import LoraConfig, PeftModel
13
14base_model_name = "NousResearch/Llama-2-7b-chat-hf"
15finetuned_model = "dasanindya15/llama2-7b_qlora_Cladder_v1"
16
17# Load the entire model on the GPU 0
18device_map = {"": 0}
19
20# Reload model in FP16 and merge it with LoRA weights
21base_model = AutoModelForCausalLM.from_pretrained(
22 base_model_name,
23 low_cpu_mem_usage=True,
24 return_dict=True,
25 torch_dtype=torch.float16,
26 device_map=device_map,
27)
28model = PeftModel.from_pretrained(base_model, finetuned_model)
29model = model.merge_and_unload()
30
31# Reload tokenizer to save it
32tokenizer = AutoTokenizer.from_pretrained(base_model_name, trust_remote_code=True)
33tokenizer.add_special_tokens({'pad_token': '[PAD]'})
34tokenizer.pad_token = tokenizer.eos_token
35tokenizer.padding_side = "right"
36