Views
No views yet
1from transformers import AutoTokenizer, BitsAndBytesConfig, Gemma3ForCausalLM
2import torch
3
4model_id = "gghfez/gemma-3-27b-novision"
5
6quantization_config = BitsAndBytesConfig(load_in_8bit=True)
7
8model = Gemma3ForCausalLM.from_pretrained(
9 model_id, quantization_config=quantization_config
10).eval()
11
12tokenizer = AutoTokenizer.from_pretrained(model_id)
13
14messages = [
15 [
16 {
17 "role": "system",
18 "content": [{"type": "text", "text": "You are a helpful assistant."},]
19 },
20 {
21 "role": "user",
22 "content": [{"type": "text", "text": "Write a poem on Hugging Face, the company"},]
23 },
24 ],
25]
26inputs = tokenizer.apply_chat_template(
27 messages,
28 add_generation_prompt=True,
29 tokenize=True,
30 return_dict=True,
31 return_tensors="pt",
32).to(model.device).to(torch.bfloat16)
33
34
35with torch.inference_mode():
36 outputs = model.generate(**inputs, max_new_tokens=64)
37
38outputs = tokenizer.batch_decode(outputs)