Views
No views yet
| Metric | Baseline (BF16) | INT8 | Change |
|---|---|---|---|
| Memory | 8.41 GB | 4.84 GB | -42.4% |
| Perplexity (WikiText-2) | 12.59 | 12.75 | +1.30% |
| GSM8K Accuracy | 86.00% | ~86% | Minimal degradation |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "AxisQuant/Qwen3.5-4B-INT8",
5 device_map="auto"
6)
7tokenizer = AutoTokenizer.from_pretrained("prashantcp8/Qwen3.5-4B-INT8")
8
9messages = [{"role": "user", "content": "What is machine learning?"}]
10prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
11inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
12
13outputs = model.generate(**inputs, max_new_tokens=256)
14response = tokenizer.decode(outputs[0][inputs.input_ids.shape[1]:], skip_special_tokens=True)
15print(response)bitsandbytes library for optimal performance1@misc{qwen3.5,
2 title={Qwen3.5 Technical Report},
3 author={Qwen Team},
4 year={2025},
5 publisher={Alibaba}
6}Note: This model is for testing and experimental purposes only. There are still some improvements required in terms of inference speed and accuracy. I plan to explore better quantization methods like AWQ or GPTQ in future iterations for optimized performance.