Views
No views yet
<answer> タグで結論を返す、文書読解に特化した32Bモデルです。| ファイル | サイズ | 目安 |
|---|---|---|
| Q4_K_M | 18GB | 推奨。RAM 32GBまたはVRAM 24GB級 |
| Q5_K_M | 22GB | 品質重視。RAM 32GB以上 |
| mmproj-f16 | 1.3GB | 視覚エンコーダ(必須・どの量子化とも組み合わせ可) |
<answer>880,000円</answer> の形式も維持)1llama-server -m Stockmark-DocReasoner-Qwen2.5-VL-32B-Q4_K_M.gguf \
2 --mmproj mmproj-Stockmark-DocReasoner-Qwen2.5-VL-32B-f16.gguf \
3 --port 8080 --jinja -c 8192 --image-min-tokens 64 --image-max-tokens 4096[image_url, text]にする)。-c 8192等でコンテキスト長を指定してください。 無指定はモデル宣言の最大長で確保しようとしてメモリ不足になります。推論過程が長いモデルなのでmax_tokensは1024以上を推奨します。--image-max-tokens 4096を推奨します。 文書画像は高解像度のため、既定では過剰に縮小され読み取りが落ちます。<answer>結論</answer>」の形式です。機械処理では<answer>タグを抽出してください(--reasoning-format noneを付けると過程もcontentに含まれ確認しやすくなります)。