Views
No views yet
1from datasets import load_dataset
2from gptqmodel import GPTQModel, QuantizeConfig
3from huggingface_hub import constants
4
5model_id = "Qwen/Qwen3-32B"
6# Save the quantized model in the HF cache directory
7cache_dir = constants.HF_HUB_CACHE
8quant_path = os.path.join(cache_dir, "models--quantized--" + model_id.replace("/", "--") + "custom--calibration")
9os.makedirs(quant_path, exist_ok=True)
10
11# Load calibration data
12calibration_dataset = []
13with open("./data/custom_calibration_dataset.jsonl", "r") as f:
14 for line in f:
15 if line.strip(): # Skip empty lines
16 item = json.loads(line)
17 calibration_dataset.append(item["text"])
18
19# Configure and run quantization
20quant_config = QuantizeConfig(bits=4, group_size=128)
21model = GPTQModel.load(model_id, quant_config)
22model.quantize(calibration_dataset, batch_size=2)
23model.save(quant_path)