Views
No views yet
Olmo-3-7B-Think-DPO based on QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals, a state-of-the-art quantization method of large reasoning models via fine-tuning signalsvLLM, which is the recommended way of inference. To obtain the real quantized version, please refer to our Github repo. We use an existing CUDA kernel to support the inference of 4-bit real quantized models.Olmo-3-7B-Think-DPOvLLM due to its inference optimization. Please use the tokenizer of allenai/Olmo-3-7B-Think-DPO.mit-han-lab/pile-val-backup) to obtain this model.1@misc{zhang2026quantlrmquantizationlargereasoning,
2 title={QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals},
3 author={Nan Zhang and Eugene Kwek and Yusen Zhang and Muyu Pan and Suhang Wang and Prasenjit Mitra and Rui Zhang},
4 year={2026},
5 eprint={2602.02581},
6 archivePrefix={arXiv},
7 primaryClass={cs.LG},
8 url={https://arxiv.org/abs/2602.02581},
9}Zhang, N., Kwek, E., Zhang, Y., Pan, M., Wang, S., Mitra, P., & Zhang, R. (2026). QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals. arXiv preprint arXiv:2602.02581.