Views
No views yet
unsloth/Qwen3-1.7B1from llama_cpp import Llama
2
3llm = Llama(
4 model_path="Qwen3-1.7B-korean-compressor-GGUF.gguf",
5 n_ctx=1024,
6 n_gpu_layers=-1, # offload all layers to GPU; use 0 for CPU-only
7)
8
9SYSTEM_PROMPT = "Compress the Korean prompt. Output ONLY the compressed question. ..."
10
11out = llm.create_chat_completion(
12 messages=[
13 {"role": "system", "content": SYSTEM_PROMPT},
14 {"role": "user", "content": "Original Korean prompt"},
15 ],
16 max_tokens=256,
17 temperature=0.1,
18)
19print(out["choices"][0]["message"]["content"])ko-prompt-compressor package:1pip install "ko-prompt-compressor[llm]"
2ko-compress "original prompt" --model qwen3-ko-compressor