Views
No views yet
OpenCaption-2B-VL-SFT-v1.0 is a vision-language captioning model built on top of Qwen/Qwen3-VL-2B-Instruct. It was trained for image captioning and high-quality dense image captioning using a fine-grained mixture of long-form image description traces. The model is designed to produce richer visual understanding than conventional captions by capturing scene composition, object relationships, spatial reasoning, attributes, actions, lighting, background context, and fine visual details.
[!NOTE] This model is an experimental release and may produce unexpected outputs in some scenarios.
| File Name | Quant Type | File Size | File Link |
|---|---|---|---|
| OpenCaption-2B-VL-SFT-v1.0.BF16.gguf | BF16 | 3.45 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.F16.gguf | F16 | 3.45 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.F32.gguf | F32 | 6.89 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.Q3_K_L.gguf | Q3_K_L | 1 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.Q3_K_M.gguf | Q3_K_M | 940 MB | Download |
| OpenCaption-2B-VL-SFT-v1.0.Q3_K_S.gguf | Q3_K_S | 867 MB | Download |
| OpenCaption-2B-VL-SFT-v1.0.Q4_0.gguf | Q4_0 | 1.05 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.Q4_K_M.gguf | Q4_K_M | 1.11 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.Q4_K_S.gguf | Q4_K_S | 1.06 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.Q5_0.gguf | Q5_0 | 1.23 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.Q5_K_M.gguf | Q5_K_M | 1.26 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.Q5_K_S.gguf | Q5_K_S | 1.23 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.Q6_K.gguf | Q6_K | 1.42 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.Q8_0.gguf | Q8_0 | 1.83 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.mmproj-bf16.gguf | mmproj-bf16 | 823 MB | Download |
| OpenCaption-2B-VL-SFT-v1.0.mmproj-f16.gguf | mmproj-f16 | 823 MB | Download |
| OpenCaption-2B-VL-SFT-v1.0.mmproj-f32.gguf | mmproj-f32 | 1.63 GB | Download |
| OpenCaption-2B-VL-SFT-v1.0.mmproj-q8_0.gguf | mmproj-q8_0 | 445 MB | Download |