Views
No views yet
compressed-tensors (nvfp4-pack-quantized) gotowym do vLLM.lm_head (pełna precyzja)llm-compressor, 512 próbek polskiej Wikipedii,
długość sekwencji 2048. Kalibracja na polskim tekście dla zachowania jakości w języku docelowym.vllm serve <repo>/Bielik-PL-Minitron-7B-v3.0-Instruct-NVFP4 --max-model-len 8192num_speculative_tokens=2 optymalne na RTX 4090):1vllm serve <repo>/Bielik-PL-Minitron-7B-v3.0-Instruct-NVFP4 --max-model-len 8192 \
2 --speculative-config '{"model": "<repo>/Bielik-1.5B-NVFP4", "num_speculative_tokens": 2}'