Views
No views yet
Qwen/Qwen3-0.6B-Base using optimum-quanto with int2 weight quantization.1from transformers import AutoTokenizer, AutoModelForCausalLM
2from optimum.quanto import QuantizedModelForCausalLM
3
4# Load tokenizer and model directly
5tokenizer = AutoTokenizer.from_pretrained("CarlOwOs/Qwen3-0.6B-Base-int2", trust_remote_code=True)
6model = QuantizedModelForCausalLM.from_pretrained("CarlOwOs/Qwen3-0.6B-Base-int2")
7
8# Generate text
9inputs = tokenizer("Hello, how are you?", return_tensors="pt")
10outputs = model.generate(**inputs, max_length=50, do_sample=True, temperature=0.7)
11print(tokenizer.decode(outputs[0], skip_special_tokens=True))1# If the direct method doesn't work, try this:
2from transformers import AutoTokenizer
3from optimum.quanto import QuantizedModelForCausalLM
4
5tokenizer = AutoTokenizer.from_pretrained("CarlOwOs/Qwen3-0.6B-Base-int2", trust_remote_code=True)
6model = QuantizedModelForCausalLM.from_pretrained("CarlOwOs/Qwen3-0.6B-Base-int2")
7
8# Use the model for inference
9inputs = tokenizer("What is the capital of France?", return_tensors="pt")
10with torch.no_grad():
11 outputs = model.generate(
12 **inputs,
13 max_length=100,
14 do_sample=True,
15 temperature=0.7,
16 pad_token_id=tokenizer.eos_token_id
17 )
18generated_text = tokenizer.decode(outputs[0], skip_special_tokens=True)
19print(generated_text)