Views
No views yet
softjapan/softjapan-model(ベース: Qwen/Qwen2.5-3B-Instruct)を GGUF 形式へ変換した配布用アーティファクトです。llama.cpp 系ツールや llama-cpp-python 等、GGUF 対応ランタイムで手軽に推論できます。注意: ここに含まれるのは 推論用の重み(GGUF) です。学習用の Hugging Face 形式(config.json,model.safetensorsなど)は別リポジトリ(softjapan/softjapan-model)をご参照ください。
softjapan/softjapan-model)を GGUF へ変換| ファイル名 | 形式 | 概要 | 用途の目安 |
|---|---|---|---|
softjapan-model-f16.gguf | f16 | 非量子化(16-bit float) | 最高精度/検証 |
softjapan-model-q8_0.gguf | q8_0 | 8-bit 量子化(互換性の高い方式) | 精度とサイズのバランス |
量子化方式はランタイムやメモリに応じて選択してください。軽量化をさらに重視する場合は、llama.cppの新しい量子化(例: q4_k_m など)で再変換してください。
1# (推奨) Git LFS 経由
2git lfs install
3git clone https://huggingface.co/softjapan/softjapan-model-gguf
4cd softjapan-model-gguf
5
6# もしくは huggingface-cli
7# pip install -U huggingface_hub
8huggingface-cli download softjapan/softjapan-model-gguf softjapan-model-q8_0.gguf --local-dir .1# ビルド例(省略可)
2# make -j
3
4# 単発プロンプト
5./main -m softjapan-model-q8_0.gguf \
6 -p "以下の質問に日本語で簡潔に答えてください。Q: 富士山の標高は?" \
7 -n 256 --temp 0.7 --top-p 0.9<|im_start|>role ... <|im_end|>)が有効です。
llama.cpp のビルドによっては --chat-template オプションで Qwen/ChatML テンプレートを指定できます(サポート無い場合は手動で整形してください)。1# (テンプレ対応ビルドの場合の一例)
2./main -m softjapan-model-q8_0.gguf \
3 --chat-template "qwen2" \
4 -n 256 --temp 0.7 --top-p 0.9<|im_start|>system
あなたは有能な日本語アシスタントです。簡潔かつ正確に回答してください。<|im_end|>
<|im_start|>user
あなたは誰ですか?<|im_end|>
<|im_start|>assistantllama-cpp-python1# pip install -U llama-cpp-python # (環境に応じて OpenBLAS/Metal/CUDA 版を選択)
2from llama_cpp import Llama
3
4llm = Llama(
5 model_path="softjapan-model-q8_0.gguf",
6 n_ctx=4096,
7 n_threads=8,
8)
9
10prompt = """<|im_start|>system
11あなたは有能な日本語アシスタントです。簡潔かつ正確に回答してください。<|im_end|>
12<|im_start|>user
13あなたは誰ですか?<|im_end|>
14<|im_start|>assistant
15"""
16
17out = llm(
18 prompt,
19 max_tokens=256,
20 temperature=0.7,
21 top_p=0.9,
22 stop=["<|im_end|>"]
23)
24print(out["choices"][0]["text"].strip())max_tokens: 128–512temperature: 0.6–0.8top_p: 0.8–0.95repeat_penalty(対応ランタイムのみ): 1.05–1.15"<|im_end|>" を stop に指定すると過剰出力が減ります。q8_0 は精度維持に優れますが、より小さいフットプリントが必要な場合は別量子化での再変換をご検討ください。