Views
No views yet
zai-org/GLM-4.5-AirNotes: Keeplm_headin high precision; calibrate on long, domain-relevant sequences.
sudo docker run --runtime nvidia --gpus all -p 8000:8000 --ipc=host -e VLLM_USE_FLASHINFER_MOE_FP4=1 vllm/vllm-openai:nightly --model Firworks/GLM-4.5-Air-nvfp4 --dtype auto --max-model-len 32768