Views
No views yet
./llama-cli -hf Intel/MiroThinker-v1.5-30B-gguf-q2ks-mixed-AutoRound1import torch
2from auto_round import AutoRound
3from auto_round.utils import llm_load_model
4
5model_name = "miromind-ai/MiroThinker-v1.5-30B"
6
7model, tokenizer=llm_load_model(model_name,trust_remote_code=False,device="cpu")
8layer_config = {}
9for n, m in model.named_modules():
10 if isinstance(m,torch.nn.Embedding):
11 layer_config[n] = {"bits": 8}
12 if isinstance(m, torch.nn.Linear):
13 if n=="lm_head":
14 layer_config[n] = {"bits": 8}
15 continue
16 if "expert" in n and "shared_experts" not in n:
17 layer_config[n] = {"bits": 2}
18 elif n != "lm_head":
19 layer_config[n] = {"bits": 4}
20 print(n, 4)
21
22ar = AutoRound(model, tokenizer=tokenizer, iters=0, scheme="gguf:q2_k_s", layer_config=layer_config)
23ar.quantize_and_save(format="gguf:q2_k_s", output_dir="./MiroThinker-v1.5-30B-gguf-q2ks-mixed")1@article{cheng2025signroundv2,
2 title={SignRoundV2: Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs},
3 author={Cheng, Wenhua and Zhang, Weiwei and Guo, Heng and Shen, Haihao},
4 journal={arXiv preprint arXiv:2512.04746},
5 year={2025}
6}