Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2from llmcompressor.modifiers.quantization import QuantizationModifier
3from llmcompressor import oneshot
4
5# Configuration
6MODEL_ID = "huihui-ai/Huihui-Qwen3-8B-abliterated-v2"
7SAVE_DIR = "Huihui-Qwen3-8B-abliterated-v2-FP8"
8
9# Load model
10print(f"Loading model: {MODEL_ID} ...")
11
12tokenizer = AutoTokenizer.from_pretrained(
13 MODEL_ID,
14 trust_remote_code=True
15)
16
17model = AutoModelForCausalLM.from_pretrained(
18 MODEL_ID,
19 device_map="auto",
20 torch_dtype="auto",
21 trust_remote_code=True
22)
23
24# Configure quantization scheme: FP8 dynamic quantization, no calibration data needed
25recipe = QuantizationModifier(
26 targets="Linear",
27 scheme="FP8_DYNAMIC",
28 ignore=["lm_head"] # Maintain output stability
29)
30
31# Execute quantization
32print("Starting to apply FP8 quantization (this may take a few minutes)...")
33
34oneshot(
35 model=model,
36 recipe=recipe,
37)
38
39# Save model
40print(f"Quantization complete, saving model to: {SAVE_DIR} ...")
41
42model.save_pretrained(
43 SAVE_DIR,
44 save_compressed=True,
45 max_shard_size="50GB"
46)
47tokenizer.save_pretrained(SAVE_DIR)
48
49print("Save successful!")
50print(f"You can load this model using vLLM: vllm serve {SAVE_DIR} --quantization fp8")1from huggingface_hub import login
2
3# Login
4login(token=hf_token)
5
6# Use model.push_to_hub() directly
7REPO_ID = "YifeiDevs/Huihui-Qwen3-8B-abliterated-v2-FP8"
8
9print(f"Pushing model to {REPO_ID} ...")
10
11model.push_to_hub(
12 REPO_ID,
13 private=False,
14 commit_message="Upload FP8 quantized model",
15 max_shard_size="50GB"
16)
17
18tokenizer.push_to_hub(
19 REPO_ID,
20 commit_message="Upload tokenizer"
21)
22
23print(f"✅ Push successful!")
24print(f"Model link: https://huggingface.co/{REPO_ID}")