Views
No views yet
deepseek-ai/DeepSeek-V4-Pro with MoE layers quantized to NVFP4 and attention layers quantized to FP8 blockvllm serve RedHatAI/DeepSeek-V4-Pro-NVFP4-FP8-BLOCK --tensor_parallel_size 8 --kv_cache_dtype=fp8examples/quantizing_moe/deepseek_v4_pro_example.py [DSV4] DeepSeekV4 Pro. Quantizing the model with data parallelism and 6xA100 takes about 3 hours.| Benchmark | deepseek-ai/DeepSeek-V4-Pro-Base | deepseek-ai/DeepSeek-V4-Pro | RedHatAI/DeepSeek-V4-Pro-NVFP4-FP8 |
|---|---|---|---|
| GPQA | 90.1 | 0.93 (380/792 samples) | |
| GSM8K | 91.1 | 92.6 | 91.0 |