Views
No views yet
DeepSeek-R1-0528-Qwen3-8B based on QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals, a state-of-the-art quantization method of large reasoning models via fine-tuning signals.vLLM, which is the recommended way of inference. To obtain the real quantized version, please refer to our Github repo. We use an existing CUDA kernel to support the inference of 4-bit real quantized models.DeepSeek-R1-0528-Qwen3-8Bdeepseek-ai/DeepSeek-R1-0528-Qwen3-8BvLLM due to its inference optimization. Please use the tokenizer of deepseek-ai/DeepSeek-R1-0528-Qwen3-8B.1python compare_weight_matrix.py
2python quadratic_mapping.py # supports processing weight updates on GPU1python -m awq.entry --model_path /PATH/TO/LRM \
2 --w_bit 3 --q_group_size 128 --run_awq --dump_awq QuantLRM_cache/R1-Qwen3-8B-w3-g128.ptvLLM:1python -m awq.entry --model_path /PATH/TO/LRM \
2 --w_bit 3 --q_group_size 128 \
3 --load_awq QuantLRM_cache/R1-Qwen3-8B-w3-g128.pt \
4 --q_backend fake --dump_fake models/R1-Qwen3-8B-w3-g128
5
6CUDA_VISIBLE_DEVICES=0 python inference_vllm.pymit-han-lab/pile-val-backup) to obtain this model.1@misc{zhang2026quantlrmquantizationlargereasoning,
2 title={QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals},
3 author={Nan Zhang and Eugene Kwek and Yusen Zhang and Muyu Pan and Suhang Wang and Prasenjit Mitra and Rui Zhang},
4 year={2026},
5 eprint={2602.02581},
6 archivePrefix={arXiv},
7 primaryClass={cs.LG},
8 url={https://arxiv.org/abs/2602.02581},
9}Zhang, N., Kwek, E., Zhang, Y., Pan, M., Wang, S., Mitra, P., & Zhang, R. (2026). QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals. arXiv preprint arXiv:2602.02581.