Full vision-language model after Stage 2 instruction fine-tuning on LLaVA-Instruct-150K.
LoRA weights have been merged into the base model for easy inference.
1from transformers import AutoModel, AutoTokenizer
2from PIL import Image
3
4model = AutoModel.from_pretrained(
5 "SkyAsl/Nanbeige4.1-VLM",
6 trust_remote_code=True,
7)
8model.to("cuda")
9
10tokenizer = AutoTokenizer.from_pretrained(
11 "SkyAsl/Nanbeige4.1-VLM",
12 trust_remote_code=True,
13)
14model.set_tokenizer(tokenizer)
15
16image = Image.open("photo.jpg")
17result = model.describe(image, prompt="What do you see in this image?")
18print(result)