Views
No views yet
| Parameter | Value |
|---|---|
| Method | AWQ (GEMM kernel) |
| Bits | 4 |
| Group size | 128 |
| Calibration | WikiText-2 (512 samples) |
| Benchmark | BF16 Baseline | AWQ 4-bit | Drop |
|---|---|---|---|
| GSM8K accuracy | 19.0% | pending | — |
| BoolQ accuracy | 87.5% | pending | — |
| MS MARCO ROUGE-L | 0.0616 | pending | — |
AWQ benchmark evaluation in progress. Results will be updated once complete.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "shantipriya/Qwen3-8B-AWQ-4bit",
5 device_map="auto"
6)
7tokenizer = AutoTokenizer.from_pretrained("shantipriya/Qwen3-8B-AWQ-4bit")
8
9inputs = tokenizer("Hello, how are you?", return_tensors="pt").to(model.device)
10outputs = model.generate(**inputs, max_new_tokens=100)
11print(tokenizer.decode(outputs[0], skip_special_tokens=True))