Views
No views yet
1# Interactive chat
2./llama-cli -m Qwen3.5-9B-Q4_K_M.gguf -ngl 40 -c 8192 --chat-template qwen
3
4# Server mode
5./llama-server -m Qwen3.5-9B-Q4_K_M.gguf -ngl 40 -c 8192 --port 80801from llama_cpp import Llama
2
3llm = Llama(
4 model_path="Qwen3.5-9B-Q4_K_M.gguf",
5 n_gpu_layers=40,
6 n_ctx=8192,
7)
8
9response = llm.create_chat_completion(
10 messages=[{"role": "user", "content": "Hello, how are you?"}]
11)
12print(response["choices"][0]["message"]["content"])| Configuration | Minimum RAM | Recommended RAM |
|---|---|---|
| CPU-only | 12 GB | 16 GB |
| GPU (NVIDIA) | 8 GB VRAM | 10 GB VRAM |