Views
No views yet
| Method | AWQ (Activation-Aware Weight Quantization) |
| Scheme | W4A16 asymmetric, group size 128 |
| Tool | llm-compressor |
| Calibration dataset | Proprietary (multilingual IT/EN, chat templates, code, JSON output, tool calling) |
| Calibration samples | 256 |
vllm serve Sophia-AI/Qwen3-4B-Instruct-2507-AWQ-W4A161from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "Sophia-AI/Qwen3-4B-Instruct-2507-AWQ-W4A16",
5 torch_dtype="auto",
6 device_map="auto",
7)
8tokenizer = AutoTokenizer.from_pretrained("Sophia-AI/Qwen3-4B-Instruct-2507-AWQ-W4A16")
9
10messages = [{"role": "user", "content": "Ciao, come stai?"}]
11text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
12inputs = tokenizer(text, return_tensors="pt").to(model.device)
13output = model.generate(**inputs, max_new_tokens=256)
14print(tokenizer.decode(output[0], skip_special_tokens=True))