Views
No views yet
1from llama_cpp import Llama
2
3llm = Llama(
4 model_path="HyperCLOVAX-SEED-Text-Instruct-1.5B-gguf-bf16.gguf",
5 n_gpu_layers=-1,
6 main_gpu=0,
7 n_ctx=2048
8)
9
10output = llm(
11 "재미있는 이야기 하나 만들어줘. 1000자 이상이어야 해. 시작:", # Prompt
12 max_tokens=2048,
13 echo=True,
14
15)
16print(output)1bf16, peak: 4GB
2llama_perf_context_print: load time = 210.50 ms
3llama_perf_context_print: prompt eval time = 210.42 ms / 19 tokens ( 11.07 ms per token, 90.30 tokens per second)
4llama_perf_context_print: eval time = 17923.17 ms / 2028 runs ( 8.84 ms per token, 113.15 tokens per second)
5llama_perf_context_print: total time = 21307.79 ms / 2047 tokens