Views
No views yet
EXAONE-Deep-32B.F16.ggufEXAONE-Deep-32B.Q4_K_M.ggufEXAONE-Deep-32B.Q5_K_M.ggufEXAONE-Deep-32B.Q8_0.gguf (optional)exaone.attention.layer_norm_epsilon만 존재exaone.attention.layer_norm_rms_epsilon만 존재llama-quantize가 특정 키를 찾지 못해 실패할 수 있어,
llama.cpp의 model loader에서 gguf key lookup에 fallback을 추가하는 패치를 적용했습니다.src/llama-model-loader.cpp에서 gguf_find_key() lookup에 다음 fallback을 수행하도록 수정:exaone.attention.layer_norm_epsilon이고 찾지 못하면 → exaone.attention.layer_norm_rms_epsilon로 재시도exaone.attention.layer_norm_rms_epsilon이고 찾지 못하면 → exaone.attention.layer_norm_epsilon로 재시도gguf_find_key() inside llama-model-loader.cppexaone-gguf-fallback.patch021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f21git clone https://github.com/ggml-org/llama.cpp
2cd llama.cpp
3git apply ../exaone-gguf-fallback.patch
4
5rm -rf build
6cmake -S . -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON
7cmake --build build -j1# Convert HF snapshot -> GGUF(F16)
2python3 llama.cpp/convert_hf_to_gguf.py <LOCAL_SNAPSHOT_DIR> --outtype f16 --outfile model.F16.gguf
3
4# Quantize (example: Q4_K_M)
5llama.cpp/build/bin/llama-quantize model.F16.gguf model.Q4_K_M.gguf Q4_K_M