Views
No views yet
docker run --gpus all \
--privileged --ipc=host -p 8000:8000 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
vllm/vllm-openai:muse-glimmer RedHatAI/Muse-Glimmer-30B-FP8-block \
--generation-config auto \
--tensor-parallel-size 1 \
--enable-auto-tool-choice \
--tool-call-parser muse_glimmer \
--reasoning-parser muse_glimmer1from llmcompressor import model_free_ptq
2
3MODEL_ID = "meta-models/Muse-Glimmer-30B"
4SAVE_DIR = MODEL_ID.rstrip("/").split("/")[-1] + "-FP8-block"
5
6model_free_ptq(
7 model_stub=MODEL_ID,
8 save_directory=SAVE_DIR,
9 scheme="FP8_BLOCK",
10 ignore=["re:.*vision.*", "lm_head", "re:.*embed_tokens.*"],
11 max_workers=15,
12 device="cuda:0",
13)