Views
No views yet
Qwen/Qwen3-VL-8B-Instruct for multimodal understanding in low-resource language settings. It is released as part of the FTibSuite project to support reproducible Tibetan multimodal research.onedday/FTib-VLMQwen/Qwen3-VL-8B-Instructqwen3_vlApache-2.0Qwen/Qwen3-VL-8B-Instruct using a three-stage pipeline:pip install -U transformers accelerate torch pillow"example.jpg" with your local image path.1from PIL import Image
2from transformers import AutoProcessor, AutoModelForVision2Seq
3import torch
4
5model_id = "onedday/FTib-VLM"
6
7processor = AutoProcessor.from_pretrained(model_id)
8model = AutoModelForVision2Seq.from_pretrained(
9 model_id,
10 torch_dtype=torch.bfloat16,
11 device_map="auto",
12)
13
14image = Image.open("example.jpg").convert("RGB")
15prompt = "请详细描述这张图片。"
16
17inputs = processor(
18 text=prompt,
19 images=image,
20 return_tensors="pt",
21)
22
23inputs = {
24 k: v.to(model.device) if hasattr(v, "to") else v
25 for k, v in inputs.items()
26}
27
28generated_ids = model.generate(
29 **inputs,
30 max_new_tokens=256,
31)
32
33output = processor.batch_decode(
34 generated_ids,
35 skip_special_tokens=True,
36)
37
38print(output[0])1@article{xu2026ftibsuite,
2 title={FTibSuite: A Comprehensive Resource Suite for Tibetan Vision--Language Modeling},
3 author={Xu, Guixian and Liang, Yide and Su, Zeli and Song, Xuexian and Zhang, Ziyin and Dong, Yushuang and Zhang, Ting and Han, Xu},
4 year={2026}
5}
6You may also cite this repository as:
7@misc{onedday_ftib_vlm,
8 title = {FTib-VLM},
9 author = {onedday},
10 year = {2026},
11 howpublished = {\url{https://huggingface.co/onedday/FTib-VLM}}
12}
131
2@misc{onedday_ftib_vlm,
3 title = {FTib-VLM},
4 author = {onedday},
5 year = {2026},
6 howpublished = {\url{https://huggingface.co/onedday/FTib-VLM}}
7}
8```