Views
No views yet
compressed-tensors (nvfp4-pack-quantized) gotowym do vLLM.lm_head (pełna precyzja)llm-compressor, 512 próbek polskiej Wikipedii,
długość sekwencji 2048. Kalibracja na polskim tekście dla zachowania jakości w języku docelowym.vllm serve <repo>/Bielik-4.5B-v3.0-Instruct-NVFP4 --max-model-len 8192