Views
No views yet
1import transformers
2import torch
3
4if __name__ == "__main__":
5 # model_name = "abacaj/phi-2-super"
6 model_name = "./models/phi-2-super-gptq"
7 tokenizer = transformers.AutoTokenizer.from_pretrained(model_name)
8
9 model = transformers.AutoModelForCausalLM.from_pretrained(
10 model_name,
11 torch_dtype=torch.float16,
12 device_map="cuda",
13 ).eval()
14
15 messages = [{"role": "user", "content": "Hello, who are you?"}]
16 inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(
17 model.device
18 )
19 input_ids_cutoff = inputs.size(dim=1)
20
21 with torch.no_grad():
22 generated_ids = model.generate(
23 input_ids=inputs,
24 use_cache=True,
25 max_new_tokens=512,
26 temperature=0.2,
27 top_p=0.95,
28 do_sample=True,
29 eos_token_id=tokenizer.eos_token_id,
30 pad_token_id=tokenizer.pad_token_id,
31 )
32
33 completion = tokenizer.decode(
34 generated_ids[0][input_ids_cutoff:],
35 skip_special_tokens=True,
36 )
37
38 print(completion)