Views
No views yet
kakaocorp/kanana-2-30b-a3b-instruct-2601,
so it runs in llama.cpp — e.g. as the Korean endpoint of
local-llm-toolkit on a 16 GB GPU.| Base model | kakaocorp/kanana-2-30b-a3b-instruct-2601 (30B, ~3B active MoE) |
| Format | GGUF, Q4_K_M (~18.6 GB) |
| Tooling | llama.cpp convert_hf_to_gguf.py (BF16 → F16) → llama-quantize (Q4_K_M) |
1# llama.cpp server (fits 16 GB with some MoE layers offloaded to CPU)
2llama-server -m kanana-2-30b-a3b-instruct-2601-Q4_K_M.gguf \
3 -ngl 99 --n-cpu-moe 18 -c 16384 --jinja -a kanana-2
4
5# or via local-llm-toolkit
6./llm up ko && ./llm chat --ko