Views
No views yet
| File | Size | SHA-256 |
|---|---|---|
dspark-DeepSeek-V4-Flash-0731-EXPERT-Q2_K.gguf | 6.963 GB (6.485 GiB) | 4a05eaa5d94a73c00160bf988b567b55f0b32e2b6f322714eaefe46b828b218c |
dspark-DeepSeek-V4-Flash-0731-Q8_0.gguf from unsloth/DeepSeek-V4-Flash-0731-GGUF.llama-quantize:blk.[0-2].ffn_(down|gate|up)_exps.weight: Q2_Kmarkov_w1.weight, markov_w2.weight: F16Q8_0--allow-requantize --pure1llama-quantize \
2 --allow-requantize \
3 --pure \
4 --tensor-type 'blk\.[0-2]\.ffn_(down|gate|up)_exps\.weight=q2_k' \
5 --tensor-type 'markov_w[12]\.weight=f16' \
6 dspark-DeepSeek-V4-Flash-0731-Q8_0.gguf \
7 dspark-DeepSeek-V4-Flash-0731-EXPERT-Q2_K.gguf \
8 Q8_01llama-server \
2 -m /models/main/DeepSeek-V4-Flash-0731-UD-Q2_K_XL-00001-of-00003.gguf \
3 --spec-draft-model /models/draft/dspark-DeepSeek-V4-Flash-0731-EXPERT-Q2_K.gguf \
4 --spec-type draft-dspark \
5 --spec-draft-ngl all \
6 --spec-draft-n-max 3 \
7 --spec-draft-p-min 0.0 \
8 --ctx-size 524288 \
9 --n-gpu-layers all \
10 --flash-attn onDeepSeek-V4-Flash-0731-UD-Q2_K_XL as the main model and loaded this file through --spec-draft-model.