Views
No views yet
lm_head (language model head)model.visual.*).*mlp.gate$)pip install transformers torch qwen-vl-utils pillow1from transformers import AutoProcessor, Qwen3VLForConditionalGeneration
2from PIL import Image
3import requests
4
5# Load model and processor
6model = Qwen3VLForConditionalGeneration.from_pretrained(
7 "JEILDLWLRMA/Qwen3-VL-8B-Instruct-NVFP4",
8 torch_dtype="auto",
9 device_map="auto"
10)
11processor = AutoProcessor.from_pretrained("JEILDLWLMRA/Qwen3-VL-8B-Instruct-NVFP4")
12
13# Prepare inputs
14image_url = "http://images.cocodataset.org/train2017/000000231895.jpg"
15image = Image.open(requests.get(image_url, stream=True).raw)
16
17messages = [
18 {
19 "role": "user",
20 "content": [
21 {"type": "image", "image": image_url},
22 {"type": "text", "text": "What does the image show?"},
23 ],
24 }
25]
26
27# Process and generate
28prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
29inputs = processor(
30 text=[prompt],
31 images=[image],
32 padding=False,
33 return_tensors="pt",
34).to(model.device)
35
36output = model.generate(**inputs, max_new_tokens=100, temperature=0.7)
37generated_text = processor.decode(output[0], skip_special_tokens=True)
38print(generated_text)1from vllm import LLM
2from vllm.multimodal.utils import encode_image_base64
3from PIL import Image
4import base64
5from io import BytesIO
6
7# Initialize vLLM engine
8llm = LLM(
9 model="JEILDLWLMRA/Qwen3-VL-8B-Instruct-NVFP4",
10 max_model_len=8192,
11 limit_mm_per_prompt={"image": 1, "video": 0},
12 trust_remote_code=True,
13)
14
15# Prepare image
16image = Image.open("path/to/image.jpg")
17buffered = BytesIO()
18image.save(buffered, format="PNG")
19img_str = base64.b64encode(buffered.getvalue()).decode()
20
21# Generate
22messages = [
23 {
24 "role": "user",
25 "content": [
26 {"type": "image", "image": f"data:image/png;base64,{img_str}"},
27 {"type": "text", "text": "Describe this image."},
28 ],
29 }
30]
31
32outputs = llm.chat(messages, max_tokens=100)
33print(outputs[0].outputs[0].text)1@article{qwen3vl,
2 title={Qwen3-VL: A Versatile Vision-Language Model},
3 author={Qwen Team},
4 journal={arXiv preprint},
5 year={2024}
6}