Views
No views yet
| Component | Scheme | Details |
|---|---|---|
| Attention Layers | FP8_DYNAMIC | W8A8, preserves precision for Q/K/V/O projections |
| MLP Layers | NVFP4 | W4A4, optimizes latency for gate/up/down projections |
| Vision Encoder | BF16 (unquantized) | Full precision for visual understanding |
| LM Head | BF16 (unquantized) | Full precision for output quality |
1vllm serve JEILDLWLRMA/Qwen3-VL-8B-Instruct-NVFP4-FP8-Dynamic \
2 --quantization compressed-tensors \
3 --kv-cache-dtype fp8 \
4 --gpu-memory-utilization 0.9 \
5 --enforce-eager \
6 --max-model-len 81921from vllm import LLM, SamplingParams
2
3llm = LLM(
4 model="JEILDLWLRMA/Qwen3-VL-8B-Instruct-NVFP4-FP8-Dynamic",
5 quantization="compressed-tensors",
6 trust_remote_code=True,
7 kv_cache_dtype="fp8",
8 max_model_len=8192,
9)
10
11sampling_params = SamplingParams(temperature=0.7, top_p=0.95)
12prompts = ["Your prompt here"]
13outputs = llm.generate(prompts, sampling_params)1from transformers import AutoProcessor, Qwen3VLForConditionalGeneration
2import torch
3
4model_id = "JEILDLWLRMA/Qwen3-VL-8B-Instruct-NVFP4-FP8-Dynamic"
5processor = AutoProcessor.from_pretrained(model_id)
6model = Qwen3VLForConditionalGeneration.from_pretrained(
7 model_id,
8 torch_dtype=torch.bfloat16,
9 device_map="auto",
10 trust_remote_code=True,
11)self_attn.(q_proj|k_proj|v_proj|o_proj|qkv_proj|qkv)mlp.(gate_proj|up_proj|down_proj|gate_up_proj)visual.*), output head (lm_head), MoE gates (mlp.gate)recipe.yaml)