Views
No views yet

Qwen3-VisionCaption-2B is an abliterated v1.0 variant built upon Qwen3-VL-2B-Instruct-abliterated-v1, specifically optimized for seamless, high precision image captioning and uncensored visual analysis. It is engineered for robust caption generation, deep reasoning, and unrestricted descriptive understanding across diverse visual and multimodal contexts.
1from transformers import Qwen3VLForConditionalGeneration, AutoProcessor
2from qwen_vl_utils import process_vision_info
3import torch
4
5model = Qwen3VLForConditionalGeneration.from_pretrained(
6 "prithivMLmods/Qwen3-VisionCaption-2B", torch_dtype="auto", device_map="auto"
7)
8
9processor = AutoProcessor.from_pretrained("prithivMLmods/Qwen3-VisionCaption-2B")
10
11messages = [
12 {
13 "role": "user",
14 "content": [
15 {
16 "type": "image",
17 "image": "https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen-VL/assets/demo.jpeg",
18 },
19 {"type": "text", "text": "Provide a detailed caption and reasoning for this image."},
20 ],
21 }
22]
23
24text = processor.apply_chat_template(
25 messages, tokenize=False, add_generation_prompt=True
26)
27image_inputs, video_inputs = process_vision_info(messages)
28
29inputs = processor(
30 text=[text],
31 images=image_inputs,
32 videos=video_inputs,
33 padding=True,
34 return_tensors="pt",
35)
36inputs = inputs.to("cuda")
37
38generated_ids = model.generate(**inputs, max_new_tokens=128)
39generated_ids_trimmed = [
40 out_ids[len(in_ids):] for in_ids, out_ids in zip(inputs.input_ids, generated_ids)
41]
42output_text = processor.batch_decode(
43 generated_ids_trimmed, skip_special_tokens=True, clean_up_tokenization_spaces=False
44)
45print(output_text)| Preview 1 | Preview 2 |
|---|---|
![]() | ![]() |
Find the Quants (GGUF) here: https://huggingface.co/prithivMLmods/Qwen3-VisionCaption-2B-GGUF