Views
No views yet
| Property | Value |
|---|---|
| Base model | deepseek-ai/DeepSeek-V2-Lite |
| Parameters | 15.7B total (2.4B active) |
| Architecture | DeepSeek-V2 (MLA + MoE, 64 experts, top-6) |
| Quantization | Per-group FP8 (E4M3), dynamic activations |
| Weight strategy | Group, group_size=64 |
| Activation strategy | Per-token, dynamic |
| Format | compressed-tensors (float-quantized) |
| Ignored layers | lm_head |
| Model size | ~16 GB |
| Tool | llm-compressor 0.10.0 |
weight_block_size: [1, 64]), making it useful for testing and validating group FP8 inference paths (e.g., MLA attention + group FP8 fusion in vLLM) without needing a 671B model.| Model | exact_match |
|---|---|
| Baseline (BF16) | 0.300 |
| FP8-Group (this model) | 0.330 |
vllm serve carlyou/DeepSeek-V2-Lite-FP8-Group --trust-remote-code1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "carlyou/DeepSeek-V2-Lite-FP8-Group",
5 torch_dtype="auto",
6 trust_remote_code=True,
7 device_map="auto",
8)
9tokenizer = AutoTokenizer.from_pretrained(
10 "carlyou/DeepSeek-V2-Lite-FP8-Group",
11 trust_remote_code=True,
12)1pip install llmcompressor transformers
2python quantize.py --model deepseek-ai/DeepSeek-V2-Lite --scheme fp8-group