Views
No views yet
1{
2 "zero_point": true,
3 "q_group_size": 128,
4 "w_bit": 4,
5 "version": "GEMM"
6}1pip install vllm
2
3python -m vllm.entrypoints.openai.api_server \
4 --model your-username/Qwen3-14B-AWQ \
5 --quantization awq \
6 --tensor-parallel-size 21from awq import AutoAWQForCausalLM
2from transformers import AutoTokenizer
3
4model = AutoAWQForCausalLM.from_quantized(
5 "your-username/Qwen3-14B-AWQ",
6 device_map="auto",
7 trust_remote_code=True,
8)
9tokenizer = AutoTokenizer.from_pretrained(
10 "your-username/Qwen3-14B-AWQ",
11 trust_remote_code=True,
12)
13
14# Generate
15prompt = "Write a hello world in Python:"
16inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
17outputs = model.generate(**inputs, max_new_tokens=100)
18print(tokenizer.decode(outputs[0]))1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "your-username/Qwen3-14B-AWQ",
5 device_map="auto",
6 trust_remote_code=True,
7)
8tokenizer = AutoTokenizer.from_pretrained(
9 "your-username/Qwen3-14B-AWQ",
10 trust_remote_code=True,
11)<|im_start|>system
You are a helpful assistant.<|im_end|>
<|im_start|>user
Hello, how are you?<|im_end|>
<|im_start|>assistant
I'm doing well, thank you!<|im_end|>