Views
No views yet
llama-server settings below, it just fits in 32GB of VRAM with a 262,144 token context.| Component | Detail |
|---|---|
| GPU | NVIDIA RTX 5090 (Blackwell) |
| OS | Windows |
| Runtime | llama-server (main branch) |
| Conversion tooling | llama.cpp PR branch pr-21095 |
| Context window | 262,144 tokens |
| Generation speed | ~75-100+ tokens/sec |
llama.cpp branch1cd .\llama.cpp
2git fetch origin pull/21095/head:pr-21095
3git checkout pr-21095
4python -m pip install --no-cache-dir -r requirements\requirements-convert_hf_to_gguf.txt1(Get-Content <model_dir>\tokenizer_config.json) `
2 -replace '"tokenizer_class": "TokenizersBackend"', '"tokenizer_class": "Qwen2Tokenizer"' `
3 | Set-Content <model_dir>\tokenizer_config.jsonpython convert_hf_to_gguf.py <model_dir> --outfile <output.gguf> --outtype bf16 --verbosellama-server Settings1./llama-server ^
2 --model ../models/llm/jdermody/Qwen3.6-27B-Text-NVFP4-MTP.gguf ^
3 --alias "jdermody/Qwen3.6-27B-Text-NVFP4-MTP" ^
4 --ctx-size 262144 ^
5 --temp 0.6 ^
6 --top-p 0.95 ^
7 --min-p 0.00 ^
8 --top-k 20 ^
9 --port 8001 ^
10 --presence-penalty 0.0 ^
11 --repeat-penalty 1.0 ^
12 --flash-attn on ^
13 --jinja ^
14 --batch-size 1024 ^
15 --ubatch-size 512 ^
16 --parallel 1 ^
17 --cache-type-k q8_0 ^
18 --cache-type-v q8_0 ^
19 --spec-type draft-mtp ^
20 --spec-draft-n-max 4 ^
21 --spec-draft-type-k q4_0 ^
22 --spec-draft-type-v q4_0