1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "avinashhm/Qwen3-8B-4bit-SINQ",
5 torch_dtype=torch.bfloat16,
6 device_map="auto",
7 trust_remote_code=True
8)
9tokenizer = AutoTokenizer.from_pretrained(
10 "avinashhm/Qwen3-8B-4bit-SINQ",
11 trust_remote_code=True
12)
13
14prompt = "Describe the future of artificial intelligence."
15inputs = tokenizer(prompt, return_tensors="pt").to("cuda:0")
16outputs = model.generate(**inputs, max_new_tokens=50)
17print(tokenizer.decode(outputs[0], skip_special_tokens=True))