Views
No views yet
transformers, AutoAWQ, vLLM ou llama.cpp. Le
schéma de quantization (vyrn_int4_symmetric_grouped, voir quant_meta.json) est propriétaire
au projet vyrn : int4 symétrique (pas de zero-point), groupé par blocs de 32 sur le canal
d'entrée, empaqueté en nibbles (2 valeurs/octet). Conçu pour un kernel de dequant+matmul
maison écrit dans Burn, pas pour les kernels CUDA (Marlin, exllama...) des outils habituels.docs/features/quantization-awq.md dans le dépôt du projet.