Views
No views yet
natong19/Mistral-Nemo-Instruct-2407-abliterated,
itself an abliteration of Mistral Nemo Instruct 2407.wikimedia/wikipedia (20231101.fr)lm_head left in fp16 (preserves output quality)v_proj → o_proj smoothing is skipped on all 40 layers due to GQA shape mismatch
(32 query heads / 8 KV heads). This is standard AWQ behaviour for GQA models — quality
impact is marginal since the input_layernorm → q/k/v smoothing remains active.1vllm serve KebalBaguette/Mistral-Nemo-Instruct-2407-abliterated-AWQ \
2 --quantization compressed-tensors \
3 --max-model-len 8192