Views
No views yet
1import torch
2from peft import PeftModel
3from transformers import AutoModel, AutoTokenizer
4
5# Load Base Model
6base_model = AutoModel.from_pretrained(
7 "OpenGVLab/InternVL2_5-4B",
8 torch_dtype=torch.bfloat16,
9 trust_remote_code=True,
10 device_map="auto"
11)
12tokenizer = AutoTokenizer.from_pretrained("OpenGVLab/InternVL2_5-4B", trust_remote_code=True)
13
14# Load LoRA Adapter
15model = PeftModel.from_pretrained(base_model, "blind-assist/internvl2-5-4b-walk-lora-e3-8500")
16
17# Merge for faster inference (optional)
18model = model.merge_and_unload()
19
20# Use for inference
21response = model.chat(
22 tokenizer=tokenizer,
23 pixel_values=pixel_values, # Your preprocessed image
24 question="Describe any obstacles in this scene.",
25 generation_config=dict(max_new_tokens=256)
26)1# See our inference script at:
2# https://github.com/Blind-Assist/InternVL/blob/walkvlm/internvl_chat/test_finetuned_model.pyadapter_config.json - PEFT LoRA configurationadapter_model.safetensors - LoRA weights only (~50MB)