Views
No views yet
1from llmcompressor.modifiers.quantization import QuantizationModifier
2from llmcompressor.transformers import oneshot
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5# Load model
6model_stub = "deepseek-ai/DeepSeek-R1-0528-Qwen3-8B"
7model_name = model_stub.split("/")[-1]
8
9model = AutoModelForCausalLM.from_pretrained(
10 model_stub,
11 torch_dtype="auto",
12)
13
14tokenizer = AutoTokenizer.from_pretrained(model_stub)
15
16# Configure the quantization algorithm and scheme
17recipe = QuantizationModifier(
18 targets="Linear",
19 scheme="FP8_DYNAMIC",
20 ignore=["lm_head"],
21)
22
23# Apply quantization
24oneshot(
25 model=model,
26 recipe=recipe,
27)
28
29# Save to disk in compressed-tensors format
30save_path = model_name + "-FP8-dynamic"
31model.save_pretrained(save_path)
32tokenizer.save_pretrained(save_path)
33print(f"Model and tokenizer saved to: {save_path}")