Views
No views yet

1from transformers import AutoTokenizer
2from gptqmodel import GPTQModel
3
4model_name = "ModelCloud/Llama-3.2-1B-Instruct-gptqmodel-4bit-vortex-v2"
5
6tokenizer = AutoTokenizer.from_pretrained(model_name)
7model = GPTQModel.from_quantized(model_name)
8
9messages = [
10 {"role": "system", "content": "You are a pirate chatbot who always responds in pirate speak!"},
11 {"role": "user", "content": "Who are you?"},
12]
13input_tensor = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")
14
15outputs = model.generate(input_ids=input_tensor.to(model.device), max_new_tokens=512)
16result = tokenizer.decode(outputs[0][input_tensor.shape[1]:], skip_special_tokens=True)
17
18print(result)