Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3model_id = "lsm0729/Meta-Llama-3.1-8B-Instruct-quantized.w8a8"
4model = AutoModelForCausalLM.from_pretrained(
5 model_id,
6 device_map="auto",
7 dtype="auto"
8)
9tokenizer = AutoTokenizer.from_pretrained(model_id)
10
11# Example inference
12messages = [
13 {"role": "system", "content": "You are a helpful assistant."},
14 {"role": "user", "content": "What is the capital of France?"},
15]
16
17input_ids = tokenizer.apply_chat_template(
18 messages,
19 add_generation_prompt=True,
20 return_tensors="pt"
21).to(model.device)
22
23outputs = model.generate(
24 input_ids,
25 max_new_tokens=256,
26 do_sample=True,
27 temperature=0.6,
28 top_p=0.9,
29)
30
31response = tokenizer.decode(outputs[0][input_ids.shape[-1]:], skip_special_tokens=True)
32print(response)1@article{llama3.1,
2 title={The Llama 3 Herd of Models},
3 author={Meta AI},
4 year={2024},
5 url={https://arxiv.org/abs/2407.21783}
6}