Views
No views yet
| 项目 | 值 |
|---|---|
| 原始模型 | stepfun-ai/Step3-VL-10B |
| 语言模型架构 | Qwen3 (36层, 4096维) |
| 视觉编码器 | ViT-Large (47层, 1536维) |
| 视觉投影器 | 2层 Conv2d + Linear (stride-2 下采样) |
| 许可证 | Apache 2.0 |
| 文件 | 大小 | 说明 |
|---|---|---|
Step3-VL-10B-Q4_K_M.gguf | 4.7GB | 文本模型 (Q4_K_M 量化) |
mmproj-Step3-VL-10B-f16.gguf | 3.7GB | 视觉投影器 (F16, 包含完整 3 层 projector) |
1# 启动服务器
2llama-server \
3 -m Step3-VL-10B-Q4_K_M.gguf \
4 --mmproj mmproj-Step3-VL-10B-f16.gguf \
5 --host 0.0.0.0 --port 8080 -ngl 99
6
7# 文本推理
8curl http://localhost:8080/v1/chat/completions \
9 -H 'Content-Type: application/json' \
10 -d '{"model":"step3-vl","messages":[{"role":"user","content":"Hello"}],"max_tokens":50}'
11
12# 视觉推理 (base64 图片)
13IMG_B64=$(base64 -i image.png | tr -d '\n')
14curl http://localhost:8080/v1/chat/completions \
15 -H 'Content-Type: application/json' \
16 -d "{\"model\":\"step3-vl\",\"messages\":[{\"role\":\"user\",\"content\":[{\"type\":\"image_url\",\"image_url\":{\"url\":\"data:image/png;base64,$IMG_B64\"}},{\"type\":\"text\",\"text\":\"What is this?\"}]}],\"max_tokens\":100}"convert_hf_to_gguf.py --mmproj 从原始 safetensors 转换,包含完整的 3 层视觉投影器:mm.0 — Conv2d(1536→3072, k=3, s=2)mm.1 — Conv2d(3072→6144, k=3, s=2)mm.model.fc — Linear(6144→4096)mm.1 和 mm.model.fc,导致加载报错 unable to find tensor mm.1.weight。