Views
No views yet
auto-gptq1from transformers import AutoTokenizer, pipeline, AutoModelForCausalLM, LlamaForCausalLM, LlamaTokenizer, StoppingCriteria, PreTrainedTokenizerBase
2from auto_gptq import AutoGPTQForCausalLM
3
4model_id = 'seonglae/opt-125m-4bit-gptq'
5tokenizer = AutoTokenizer.from_pretrained(model_id, use_fast=True)
6model = AutoGPTQForCausalLM.from_quantized(
7 model_id,
8 model_basename=model_basename,
9 trust_remote_code=True,
10 device='cuda:0',
11 use_triton=False,
12 use_safetensors=True,
13)
14
15pipe = pipeline(
16 "text-generation",
17 model=model,
18 tokenizer=tokenizer,
19 temperature=0.5,
20 top_p=0.95,
21 max_new_tokens=100,
22 repetition_penalty=1.15,
23)
24prompt = "USER: Are you AI?\nASSISTANT:"
25pipe(prompt)