Views
No views yet
1import os
2# Gemma-2 use Flashinfer backend for models with logits_soft_cap. Otherwise, the output might be wrong.
3os.environ['VLLM_ATTENTION_BACKEND'] = 'FLASHINFER'
4
5from transformers import AutoTokenizer
6from gptqmodel import BACKEND, GPTQModel
7
8model_name = "ModelCloud/gemma-2-27b-it-gptq-4bit"
9
10prompt = [{"role": "user", "content": "I am in Shanghai, preparing to visit the natural history museum. Can you tell me the best way to"}]
11
12tokenizer = AutoTokenizer.from_pretrained(model_name)
13
14model = GPTQModel.from_quantized(
15 model_name,
16 backend=BACKEND.VLLM,
17 )
18
19inputs = tokenizer.apply_chat_template(prompt, tokenize=False, add_generation_prompt=True)
20outputs = model.generate(prompts=inputs, temperature=0.95, max_length=128)
21print(outputs[0].outputs[0].text)