Views
No views yet
py -3.11 -m pip install llama-cpp-python transformers1from llama_cpp import Llama
2from transformers import AutoTokenizer
3
4llm = Llama(model_path="Qwen3-8B-Q5_K_M.gguf", n_ctx=8192)
5tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3-8B")
6
7messages = [{"role": "user", "content": "Hello!"}]
8prompt = tokenizer.apply_chat_template(
9 messages, tokenize=False, add_generation_prompt=True, enable_thinking=False
10)
11out = llm(prompt, max_tokens=256, stop=[tokenizer.eos_token])
12print(out["choices"][0]["text"])