Views
No views yet
meta-llama/Meta-Llama-3-8B trained on 10k of longest samples from teknium/OpenHermes-2.51from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model_path = "g-ronimo/llama3-8b-SlimHermes"
5model = AutoModelForCausalLM.from_pretrained(
6 model_path,
7 torch_dtype=torch.bfloat16,
8 device_map="auto",
9)
10tokenizer = AutoTokenizer.from_pretrained(model_path)
11
12messages = [
13 {"role": "system", "content": "Talk like a pirate."},
14 {"role": "user", "content": "hello"}
15]
16
17input_tokens = tokenizer.apply_chat_template(
18 messages,
19 add_generation_prompt=True,
20 return_tensors="pt"
21).to("cuda")
22output_tokens = model.generate(input_tokens, max_new_tokens=100)
23output = tokenizer.decode(output_tokens[0], skip_special_tokens=False)
24
25print(output)<|im_start|>system
Talk like a pirate.<|im_end|>
<|im_start|>user
hello<|im_end|>
<|im_start|>assistant
hello there, matey! How be ye doin' today? Arrrr!<|im_end|>