Views
No views yet
1
2from transformers import AutoModelForCausalLM, AutoTokenizer
3from peft import PeftModel
4import torch
5access_token = "<HF_TOKEN>"
6
7
8tokenizer = AutoTokenizer.from_pretrained(
9 "meta-llama/Llama-2-7b-chat-hf"
10 )
11
12
13base_model = AutoModelForCausalLM.from_pretrained(
14 'meta-llama/Llama-2-7b-chat-hf',
15 token=access_token,
16 trust_remote_code=True,
17 #device_map="auto", #Uncomment if you hava a good GPU Memory
18 torch_dtype=torch.float16,
19 offload_folder="offload/"
20)
21model = PeftModel.from_pretrained(
22 base_model,
23 'manjunathshiva/GRADE3B-7B-02-0',
24 token=access_token,
25 offload_folder="offload/"
26
27).eval()
28
29# Prompt content: "When is Maths Unit Test 2?"
30messages = [
31 {"role": "user", "content": "When is Maths Unit Test 2?"}
32]
33
34input_ids = tokenizer.apply_chat_template(conversation=messages, tokenize=True, add_generation_prompt=True, return_tensors='pt')
35#output_ids = model.generate(input_ids.to('cuda')) #Uncomment if you have CUDA and comment below line
36output_ids = model.generate(input_ids=input_ids, temperature=0.01 )
37response = tokenizer.decode(output_ids[0][input_ids.shape[1]:], skip_special_tokens=True)
38
39# Model response: "<Outputs Date>"
40print(response)
41