Views
No views yet
| Filename | Quant type | File Size | Description |
|---|---|---|---|
| model-f16.gguf | F16 | Large | Original precision |
| model-q4_0.gguf | Q4_0 | Small | 4-bit quantization |
| model-q4_1.gguf | Q4_1 | Small | 4-bit quantization (higher quality) |
| model-q5_0.gguf | Q5_0 | Medium | 5-bit quantization |
| model-q5_1.gguf | Q5_1 | Medium | 5-bit quantization (higher quality) |
| model-q8_0.gguf | Q8_0 | Large | 8-bit quantization |
./llama-cli -m model-q4_0.gguf -p "Your prompt here"1from llama_cpp import Llama
2
3llm = Llama(model_path="model-q4_0.gguf")
4output = llm("Your prompt here", max_tokens=512)
5print(output['choices'][0]['text'])