Views
No views yet
1git clone https://github.com/llm-jp/llama.cpp
2cd llama.cpp
3cmake -B build -DGGML_CUDA=ON
4cmake --build build --config Release -j1hf download mmnga-o/llm-jp-4-33b-thinking-gguf \
2 llm-jp-4-33b-thinking-Q4_K_M.gguf \
3 --local-dir .
4
5./build/bin/llama-server \
6 --model ./llm-jp-4-33b-thinking-Q4_K_M.gguf \
7 --jinja \
8 -rea on \
9 --flash-attn on \
10 -ngl 99 \
11 --ctx-size 8192 \
12 --port 8080-nglは使用するGPUのVRAM容量に合わせて調整してください。