Views
No views yet
Qwen/Qwen3-8B.| Dataset | Split | Sequence length | Perplexity |
|---|---|---|---|
| WikiText2 | test | 2048 | 11.7079 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "yw223/Qwen3-8B-OmniQuant-3bit"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForCausalLM.from_pretrained(
6 model_id,
7 torch_dtype="auto",
8 device_map="auto",
9)weight_quantizer.scales and
weight_quantizer.zeros entries when loading. The fake-quantized model weights
still load through the standard Transformers path used for the reported PPL.