Views
No views yet
1from llama_cpp import Llama
2
3llm = Llama(
4 model_path="HyperCLOVAX-SEED-Text-Instruct-1.5B-gguf-q8_0.gguf",
5 n_gpu_layers=-1,
6 main_gpu=0,
7 n_ctx=2048
8)
9
10output = llm(
11 "재미있는 이야기 하나 만들어줘. 1000자 이상이어야 해. 시작:", # Prompt
12 max_tokens=2048,
13 echo=True,
14
15)
16print(output)1q8_0, peak: 1.8G
2llama_perf_context_print: load time = 186.23 ms
3llama_perf_context_print: prompt eval time = 186.15 ms / 19 tokens ( 9.80 ms per token, 102.07 tokens per second)
4llama_perf_context_print: eval time = 3141.36 ms / 536 runs ( 5.86 ms per token, 170.63 tokens per second)
5llama_perf_context_print: total time = 3758.06 ms / 555 tokens