Views
No views yet
llama.cpp 及其衍生项目进行本地推理。| 文件名 | 大小 | 说明 |
|---|---|---|
Lingshu-32B.Q4_K_M.gguf | 19.9 GB | 主模型Q4_K_M 量化版本(显存占用低,速度快) |
Lingshu-32B.Q5_K_M.gguf | 23.3 GB | 主模型Q5_K_M 量化版本(精度与速度平衡) |
Lingshu-32B.Q8_0.gguf | 34.8 GB | 主模型Q8_0 量化版本(接近全精度,精度最高) |
mmproj-Lingshu-32B.f16.gguf | 1.38 GB | 多模态视觉投影层(mmproj),用于图像特征映射,保持全精度 |
llama.cpp(以 CUDA 为例)1git clone https://github.com/ggml-org/llama.cpp
2cd llama.cpp
3cmake -B build -DLLAMA_CUDA=ON
4cmake --build build --config Release```
5
6### 2. 运行多模态推理
7**注意**:需要使用支持多模态的可执行文件 `llama-mtmd-cli`,而不是纯文本的 `llama-cli`。
8
9```bash
10./build/bin/llama-mtmd-cli \
11 -m /path/to/Lingshu-32B.Q5_K_M.gguf \
12 --mmproj /path/to/mmproj-Lingshu-32B.f16.gguf \
13 --image /path/to/your_medical_image.png \
14 -p "请识别这张图片,并给出专业的医学分析。" \
15 -ngl 999-m: 主模型 GGUF 文件路径--mmproj: 视觉投影层 GGUF 文件路径--image: 输入图片路径-p: 文本提示词-ngl: 卸载到 GPU 的层数(999 表示尽可能多)