Views
No views yet
meta-llama/Llama-3.1-8B.1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3from peft import PeftModel
4
5adapter_repo = "stegsoph/llama3.1-8b-openwebtext-llama3-lora-rx9sap"
6base_model = "meta-llama/Llama-3.1-8B"
7dtype = torch.bfloat16 if torch.cuda.is_available() and torch.cuda.is_bf16_supported() else torch.float16
8
9tokenizer = AutoTokenizer.from_pretrained(base_model)
10model = AutoModelForCausalLM.from_pretrained(base_model, torch_dtype=dtype, device_map="auto")
11model = PeftModel.from_pretrained(model, adapter_repo)
12model.eval()
13
14prompt = "Once upon a time,"
15inputs = tokenizer(prompt, return_tensors="pt")
16if torch.cuda.is_available():
17 inputs = {k: v.to("cuda") for k, v in inputs.items()}
18
19out = model.generate(
20 **inputs,
21 max_new_tokens=64,
22 temperature=0.7,
23 top_k=50,
24 top_p=0.9,
25 do_sample=True,
26 pad_token_id=tokenizer.eos_token_id,
27 eos_token_id=tokenizer.eos_token_id,
28)
29print(tokenizer.decode(out[0], skip_special_tokens=True))