Views
No views yet
vllm serve xdavxd/gemma-4-26B-A4B-it-heretic-v2-NVFP4 \
--max-model-len 32768 \
--gpu-memory-utilization 0.90vllm serve xdavxd/gemma-4-26B-A4B-it-heretic-v2-NVFP4 \
--max-model-len 32768 \
--gpu-memory-utilization 0.90 \
--enable-auto-tool-choice \
--reasoning-parser gemma4 \
--tool-call-parser gemma4 \
--chat-template examples/tool_chat_template_gemma4.jinja \
--default-chat-template-kwargs '{"enable_thinking": true}' \
--limit-mm-per-prompt '{"image": 4, "audio": 1}' \
--async-schedulingTip: For text-only workloads, pass--limit-mm-per-prompt '{"image": 0, "audio": 0}'to skip vision encoder memory allocation and free up GPU memory for a longer context window.
1from openai import OpenAI
2
3openai_api_key = "EMPTY"
4openai_api_base = "http://<your-server-host>:8001/v1"
5
6client = OpenAI(
7 api_key=openai_api_key,
8 base_url=openai_api_base,
9)
10
11model = "xdavxd/gemma-4-26B-A4B-it-heretic-NVFP4"
12
13messages = [
14 {"role": "user", "content": "Explain quantum mechanics clearly and concisely."},
15]
16
17outputs = client.chat.completions.create(
18 model=model,
19 messages=messages,
20)
21
22generated_text = outputs.choices[0].message.content
23print(generated_text)1python3 examples/llm_ptq/hf_ptq.py \
2 --model ~/models/gemma-4-26b-a4b-heretic \
3 --recipe general/ptq/nvfp4_experts_only-kv_fp8_cast \
4 --export_path ~/models/gemma-4-26b-a4b-heretic-nvfp4 \
5 --calib_size 1024 \
6 --export_fmt hf| Metric | This model | Original model (google/gemma-4-26B-A4B-it) |
|---|---|---|
| KL divergence | 0.0499 | 0 (by definition) |
| Refusals | 11/100 | 100/100 |
| Category | Benchmark | google/gemma-4-26B-A4B-it | RedHatAI/gemma-4-26B-A4B-it-NVFP4 | xdavxd/gemma-4-26B-A4B-it-heretic-NVFP4 | xdavxd/gemma-4-26B-A4B-it-heretic-v2-NVFP4 | Recovery |
|---|---|---|---|---|---|---|
| Instruction Following | IFEval (0-shot, prompt-level strict) | 89.96 | 87.24 | 87.19 | 89.16 | 99.1% |
| IFEval (0-shot, inst-level strict) | 93.21 | 91.29 | 91.05 | 92.45 | 99.2% | |
| Reasoning | GSM8K Platinum (0-shot, strict-match) | 95.43 | 94.43 | 94.49 | 95.53 | 100.0% |
| MMLU-Pro (0-shot, custom-extract) | 83.47 | 81.65 | - | 81.81* | 98.0% | |
| MATH-500 (0-shot, pass@1) | 84.80 | 87.60 | 85.13 | 85.93 | 101.3% | |
| AIME 2025 (0-shot, pass@1) | 80.00 | 66.25 | 58.75 | 77.09 | 96.36% | |
| GPQA Diamond (0-shot, pass@1) | 73.20 | 72.39 | 66.67 | 73.57 | 100.5% | |
| Coding | LiveCodeBench v6 (0-shot, pass@1) | 74.48 | 68.19 | - | - | -.-% |
sudo docker run --rm -it \
--gpus all \
--ipc=host \
--network host \
-v ~/models/gemma-4-26b-a4b-it-heretic-v2-nvfp4:/models/heretic2:ro \
-e VLLM_USE_V2_MODEL_RUNNER=1 \
ghcr.io/timothystewart6/vllm-gb10:latest \
vllm serve /models/heretic2 \
--host 0.0.0.0 --port 8001 \
--served-model-name heretic-v2 \
--max-model-len 69632 \
--gpu-memory-utilization 0.50 \
--enable-auto-tool-choice \
--reasoning-parser gemma4 \
--tool-call-parser gemma4 \
--limit-mm-per-prompt '{"image":0,"audio":0}' \
--kv-cache-dtype fp8 \
--max-num-seqs 32 \
--async-schedulingfor SEED in 1234 2345 3456; do
lm_eval --model local-chat-completions \
--tasks gsm8k_platinum_cot_llama \
--model_args "model=heretic-v2,max_length=36096,base_url=http://0.0.0.0:8001/v1/chat/completions,num_concurrent=32,max_retries=3,tokenized_requests=False,tokenizer_backend=None,timeout=2400" \
--num_fewshot 0 \
--apply_chat_template \
--output_path "results_gsm8k_seed${SEED}.json" \
--seed $SEED \
--gen_kwargs "do_sample=True,temperature=1.0,top_p=0.95,top_k=64,max_gen_toks=32000,seed=${SEED}"
echo "Seed $SEED complete"
donefor SEED in 1234 2345 3456; do
lm-eval run --model local-chat-completions \
--tasks mmlu_pro \
--model_args "model=heretic-v2,max_length=36096,base_url=http://0.0.0.0:8001/v1/chat/completions,num_concurrent=32,max_retries=3,tokenized_requests=False,tokenizer_backend=None,timeout=2400" \
--num_fewshot 0 \
--apply_chat_template \
--output_path "results_mmlu_pro_seed${SEED}.json" \
--seed $SEED \
--gen_kwargs "do_sample=True,temperature=1.0,top_p=0.95,top_k=64,max_gen_toks=32000,seed=${SEED}"
echo "MMLU-Pro seed $SEED complete"
donefor SEED in 1234 2345 3456; do
lm_eval --model local-chat-completions \
--tasks ifeval \
--model_args "model=heretic-v2,max_length=36096,base_url=http://0.0.0.0:8001/v1/chat/completions,num_concurrent=32,max_retries=3,tokenized_requests=False,tokenizer_backend=None,timeout=2400" \
--num_fewshot 0 \
--apply_chat_template \
--output_path "results_ifeval_seed${SEED}.json" \
--seed $SEED \
--gen_kwargs "do_sample=True,temperature=1.0,top_p=0.95,top_k=64,max_gen_toks=32000,seed=${SEED}"
echo "IFEval seed $SEED complete"
done1model_parameters:
2 provider: hosted_vllm
3 model_name: hosted_vllm/heretic-v2
4 base_url: http://0.0.0.0:8001/v1
5 api_key: ''
6 timeout: 7200
7 concurrent_requests: 32
8 generation_parameters:
9 temperature: 1.0
10 max_new_tokens: 65536
11 top_p: 0.95
12 top_k: 64
13 seed: 1234# GPQA Diamond (3 seeds)
for SEED in 1234 2345 3456; do
sed -i "s/seed: .*/seed: $SEED/" litellm_config.yaml
lighteval endpoint litellm litellm_config.yaml 'gpqa:diamond|0' \
--output-dir "results_gpqa_seed${SEED}/" --save-details
echo "GPQA Diamond seed $SEED complete"
done
# MATH-500 (3 seeds)
for SEED in 1234 2345 3456; do
sed -i "s/seed: .*/seed: $SEED/" litellm_config.yaml
lighteval endpoint litellm litellm_config.yaml 'math_500|0' \
--output-dir "results_math500_seed${SEED}/" --save-details
echo "MATH-500 seed $SEED complete"
done
# AIME 2025 (8 seeds)
for SEED in 1234 2345 3456 4567 5678 6789 7890 8901; do
sed -i "s/seed: .*/seed: $SEED/" litellm_config.yaml
lighteval endpoint litellm litellm_config.yaml 'aime25|0' \
--output-dir "results_aime_seed${SEED}/" --save-details
echo "AIME 2025 seed $SEED complete"
done1model_parameters:
2 provider: hosted_vllm
3 model_name: hosted_vllm/heretic
4 base_url: http://0.0.0.0:8001/v1
5 api_key: ''
6 timeout: 7200
7 concurrent_requests: 32
8 generation_parameters:
9 temperature: 1.0
10 max_new_tokens: 32768
11 top_p: 0.95
12 top_k: 64
13 seed: 1234for SEED in 1234 2345 3456; do
sed -i "s/seed: .*/seed: $SEED/" litellm_config.yaml
lighteval endpoint litellm litellm_config.yaml 'lcb:codegeneration_v6|0' \
--output-dir "results_lcb_seed${SEED}/" --save-details
echo "LiveCodeBench v6 seed $SEED complete"
done