1pip install torch==2.8.0 transformers==4.57.6 accelerate==1.10.1 \
2 timm==1.0.27 einops==0.8.2 sentencepiece==0.2.1 pillow==11.3.0
1import torch
2from transformers import AutoModel, AutoTokenizer
3
4model_id = "quiyver/intern-vl-2.5-reward"
5
6model = AutoModel.from_pretrained(
7 model_id,
8 trust_remote_code=True,
9 dtype=torch.bfloat16,
10 low_cpu_mem_usage=True,
11).cuda().eval()
12tokenizer = AutoTokenizer.from_pretrained(
13 model_id,
14 trust_remote_code=True,
15 use_fast=False,
16)
17
18scores = model.score_answers(
19 tokenizer=tokenizer,
20 image="example.jpg",
21 question="What is shown in the image?",
22 answers=[
23 "A dog is running on grass.",
24 "A passenger aircraft is taking off.",
25 ],
26)
27print(scores)
28print("preferred answer:", max(range(len(scores)), key=scores.__getitem__))
1python inference.py \
2 --model . \
3 --image example.jpg \
4 --question "What is shown in the image?" \
5 --answer "A dog is running on grass." \
6 --answer "A passenger aircraft is taking off."
1python eval_vlrewardbench.py \
2 --model . \
3 --output results/vlrewardbench_predictions.jsonl
1hf auth login
2hf upload-large-folder USER_OR_ORG/REPO_NAME . --repo-type model