Views
No views yet
1export MODEL_DIR = [local model checkpoint folder] or DeepSeek-R1-Distill-Qwen-7B
2# single GPU
3python quantize_quark.py --model_dir $MODEL_DIR \
4 --output_dir output_dir $MODEL_NAME-awq-asym-uint4-g128-lmhead \
5 --quant_scheme w_uint4_per_group_asym \
6 --num_calib_data 128 \
7 --quant_algo awq \
8 --dataset pileval_for_awq_benchmark \
9 --seq_len 512 \
10 --model_export hf_format \
11 --data_type bfloat16 \
12 --exclude_layers
13# cpu
14python quantize_quark.py --model_dir $MODEL_DIR \
15 --output_dir output_dir $MODEL_NAME-awq-asym-uint4-g128-lmhead \
16 --quant_scheme w_uint4_per_group_asym \
17 --num_calib_data 128 \
18 --quant_algo awq \
19 --dataset pileval_for_awq_benchmark \
20 --seq_len 512 \
21 --model_export hf_format \
22 --data_type bfloat16 \
23 --exclude_layers \
24 --device cpu| Benchmark | deepseek-ai/DeepSeek-R1-Distill-Qwen-7B | amd/DeepSeek-R1-Distill-Qwen-7B-awq-asym-uint4-g128-lmhead-onnx-dml (this model) |
| Perplexity-wikitext2 | 26.0455 | 28.0579 (Measured with CPU Model) |
http://www.apache.org/licenses/LICENSE-2.0