Views
No views yet
llmfan46/gemma-4-26B-A4B-it-ultra-uncensored-heretic produced with llm-compressor AWQ activation-aware scaling.compressed_tensors_moe_wna16_marlin).AWQModifier from llmcompressor main, custom Gemma-4 mappings)neuralmagic/calibration (LLM split)mlp.{gate,up,down}_proj per layer, all router.proj, vision_tower.*, embed_vision.*, lm_head. Same recipe shape as cyankiwi/gemma-4-26B-A4B-it-AWQ-4bit applied to the heretic source.1vllm serve louismuk/gemma-4-26B-A4B-heretic-AWQ \
2 --max-model-len 131072 \
3 --max-num-seqs 24 \
4 --kv-cache-dtype fp8 \
5 --enable-prefix-caching \
6 --reasoning-parser gemma4 \
7 --enable-auto-tool-choice --tool-call-parser gemma4 \
8 --hf-overrides '{"architectures":["Gemma4ForCausalLM"]}'