Views
No views yet
| File | Size | RAM needed | Use when |
|---|---|---|---|
| Q4_K_M | ~5.7 GB | ~8 GB | Recommended — best size/quality on CPU |
| Q5_K_M | ~6.7 GB | ~9 GB | More quality headroom |
| Q8_0 | ~10 GB | ~12 GB | Near-lossless |
llama-cli -m qwen3.5-9b-hindi-Q4_K_M.gguf --jinja -cnv --repeat-penalty 1.11from llama_cpp import Llama
2llm = Llama(model_path="qwen3.5-9b-hindi-Q4_K_M.gguf", n_ctx=4096)
3r = llm.create_chat_completion(
4 messages=[{"role": "user", "content": "योग के चार लाभ बताइए।"}],
5 repeat_penalty=1.1)
6print(r["choices"][0]["message"]["content"])ollama run hf.co/pankajpandey-dev/qwen3.5-9b-hindi-instruct-GGUF:Q4_K_M — needs an Ollama build with Qwen3.5 support; if it errors, use llama.cpp or LM Studio.
Tip: use repeat penalty 1.1 — long letter-style outputs can loop without it.