Views
No views yet
nn.Embedding fix that landed in 0.2.1).transformers like the original model. You need to import sdnq first so it registers into the transformers quantizer registry — without it, loading fails with a size-mismatch error:1import sdnq # registers the SDNQ quantizer into transformers
2import torch
3from transformers import AutoModelForImageTextToText, AutoProcessor
4
5model_id = "OzzyGT/gemma_4_E4B_it_sdnq_dynamic_4bit"
6
7processor = AutoProcessor.from_pretrained(model_id)
8model = AutoModelForImageTextToText.from_pretrained(model_id, dtype=torch.bfloat16, device_map="cuda")
9
10messages = [{"role": "user", "content": [{"type": "text", "text": "Explain quantization in one sentence."}]}]
11inputs = processor.apply_chat_template(
12 messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt"
13).to(model.device)
14
15out = model.generate(**inputs, max_new_tokens=256)
16print(processor.decode(out[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))