Views
No views yet
optimum-cli export openvino --model Qwen/Qwen2.5-VL-3B-Instruct \
--weight-format int8 --trust-remote-code <output_dir>VLMPipeline (GPU recommended; streaming works as
of genai 2026.1).1import numpy as np, openvino as ov, openvino_genai as og
2from PIL import Image
3pipe = og.VLMPipeline("Qwen2.5-VL-3B-Instruct-int8-ov", "GPU")
4img = ov.Tensor(np.array(Image.open("photo.jpg").convert("RGB")))
5print(pipe.generate("What is in this image?", image=img,
6 generation_config=og.GenerationConfig(max_new_tokens=128)))python nollama.py --gpu-model-dir ~/models/Qwen2.5-VL-3B-Instruct-int8-ov.
VLM prompting tip from NoLlama's docs: keep prompts dead simple for a 3B —
one question, one answer; put the logic in your code, not the prompt.