Views
No views yet
tokeninzer.modelファイルはllm-jp/llm-jp-tokenizerの
llm-jp-tokenizer-100k.ver3.0b1.modelを移植しています。convert_hf_to_gguf_update.pyのmodelsに {"name": "default", "tokt": TOKENIZER_TYPE.SPM, "repo": "/LOCAL/REPOSITORY/FOLDER", },
を追加し、convert_hf_to_gguf_update.py実行。convert_hf_to_gguf.pyではclass LlamaModelのmodify_tensorsメソッドの
最後でレイヤー名 *gate.weightを*gate_inp.weight に再変換するロジックを追加。python convert_hf_to_gguf.pyでGGUFへ変換しました。c4_en_ja_imatrix.txtを使用しました。
原著はllama.cpp:iMatrix量子化は日本語性能にどう影響するか?
です。