Views
No views yet
r=16, α=32)q_proj, k_proj, v_proj, o_proj)safetensors sharded files) vs. ~24 GB fp161from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "Irfanuruchi/Llama-2-13B-Computer-Engineering",
5 torch_dtype="auto",
6 device_map="auto"
7)
8tokenizer = AutoTokenizer.from_pretrained("Irfanuruchi/Llama-2-13B-Computer-Engineering")
9
10prompt = """### Instruction:
11Explain CPU pipelining and its advantages.
12
13### Response:"""
14
15inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
16outputs = model.generate(**inputs, max_new_tokens=256)
17print(tokenizer.decode(outputs[0], skip_special_tokens=True))
18