Views
No views yet

Original (MooMoo v2 MLX safetensors, ~18GB)
↓ dequantize (attention 8-bit → f16, MLP 4-bit → f16)
Intermediate (float16 safetensors, ~60GB)
↓ convert_hf_to_gguf.py + quantize
GGUF (various quantizations)| File | Quant | Size | Quality | Notes |
|---|---|---|---|---|
gemma-4-31b-moomoo-crack-Q3_K_M.gguf | Q3_K_M | ~14 GB | Acceptable | Minimum viable quality |
gemma-4-31b-moomoo-crack-Q4_K_M.gguf | Q4_K_M | ~18 GB | Good | Best size/quality balance |
gemma-4-31b-moomoo-crack-Q5_K_M.gguf | Q5_K_M | ~21 GB | Better | Recommended if RAM allows |
gemma-4-31b-moomoo-crack-Q6_K.gguf | Q6_K | ~25 GB | Very Good | High quality |
gemma-4-31b-moomoo-crack-Q8_0.gguf | Q8_0 | ~33 GB | Near lossless | Closest to original |
| Quantization | Minimum RAM | Recommended |
|---|---|---|
| Q3_K_M | 20 GB | 24 GB |
| Q4_K_M | 24 GB | 32 GB |
| Q5_K_M | 28 GB | 36 GB |
| Q6_K | 32 GB | 40 GB |
| Q8_0 | 40 GB | 48 GB |
.gguf file and open it in LM Studio../llama-cli -m gemma-4-31b-moomoo-crack-Q4_K_M.gguf -p "Hello" -n 2561echo 'FROM ./gemma-4-31b-moomoo-crack-Q4_K_M.gguf' > Modelfile
2ollama create gemma4-crack -f Modelfile
3ollama run gemma4-crack