Views
No views yet
llmcompressor.oneshot)QuantizationModifier with the W8A16 preset (no AWQ, no GPTQ)MuseGlimmerForConditionalGeneration so vLLM sees the correct language_model / vision_* weight pathssave_pretrained(..., save_compressed=True) (compressed-tensors)generation_config.json restored so list-valued eos_token_id is preserved for multi-stop decoding in vLLMLinear layers onlyQuantizationModifier(targets="Linear", scheme="W8A16", ...)| Pattern | Reason |
|---|---|
lm_head | Output projection; quantizing hurts quality |
re:.*vision_tower.* | Perception Encoder (~1.8B ViT-G/14) — keep BF16 |
re:.*vision_adapter.* | Muse multimodal adapter stack |
re:.*vision_projection.* | Muse vision → language projection |
re:.*multi_modal_projector.* | Defensive alias (Kimi parent / renames) |
re:.*mm_projector.* | Defensive alias |
re:.*draft.* | Speculative DFlash / drafter companion (not part of this PTQ) |
re:.*dflash.* | Speculative DFlash / drafter companion (not part of this PTQ) |
1from llmcompressor.modifiers.quantization import QuantizationModifier
2
3recipe = QuantizationModifier(
4 targets="Linear",
5 scheme="W8A16",
6 ignore=[
7 "lm_head",
8 "re:.*vision_tower.*",
9 "re:.*vision_adapter.*",
10 "re:.*vision_projection.*",
11 "re:.*multi_modal_projector.*",
12 "re:.*mm_projector.*",
13 "re:.*draft.*",
14 "re:.*dflash.*",
15 ],
16)1vllm serve TheHouseOfTheDude/Muse-Glimmer-30B-INT8 \
2 --quantization compressed-tensors1vllm serve TheHouseOfTheDude/Muse-Glimmer-30B-INT8 \
2 --quantization compressed-tensors \
3 -tp <num_gpus>temperature = 1.0top_p = 0.95top_k = 64Reasoning strength: <low|medium|high|xhigh>.