Views
No views yet
1from transformers import AutoModel, AutoProcessor
2
3model = AutoModel.from_pretrained("unum-cloud/uform-gen2-qwen-500m", trust_remote_code=True)
4processor = AutoProcessor.from_pretrained("unum-cloud/uform-gen2-qwen-500m", trust_remote_code=True)
5
6prompt = "Question or Instruction"
7image = Image.open("image.jpg")
8
9inputs = processor(text=[prompt], images=[image], return_tensors="pt")
10with torch.inference_mode():
11 output = model.generate(
12 **inputs,
13 do_sample=False,
14 use_cache=True,
15 max_new_tokens=256,
16 eos_token_id=151645,
17 pad_token_id=processor.tokenizer.pad_token_id
18 )
19
20prompt_len = inputs["input_ids"].shape[1]
21decoded_text = processor.batch_decode(output[:, prompt_len:])[0]| Model | LLM Size | SQA | MME | MMBench | Average¹ |
|---|---|---|---|---|---|
| UForm-Gen2-Qwen-500m | 0.5B | 45.5 | 880.1 | 42.0 | 29.31 |
| MobileVLM v2 | 1.4B | 52.1 | 1302.8 | 57.7 | 36.81 |
| LLaVA-Phi | 2.7B | 68.4 | 1335.1 | 59.8 | 42.95 |