Views
No views yet
1# Install llama.cpp
2git clone https://github.com/ggerganov/llama.cpp
3cd llama.cpp
4make
5
6# Run inference
7./main -m Qwen3-4B-Q4_K_M.gguf -p "Your prompt here" -n 1281from llama_cpp import Llama
2
3# Load model
4llm = Llama(
5 model_path="Qwen3-4B-Q4_K_M.gguf",
6 n_ctx=2048,
7 n_threads=8
8)
9
10# Generate text
11output = llm("Your prompt here", max_tokens=128)
12print(output['choices'][0]['text'])1from ctransformers import AutoModelForCausalLM
2
3# Load model
4llm = AutoModelForCausalLM.from_pretrained(
5 "Pinsara/Qwen3-4B-Q4_K_M-GGUF",
6 model_file="Qwen3-4B-Q4_K_M.gguf",
7 model_type="qwen2"
8)
9
10# Generate text
11print(llm("Your prompt here"))