Views
No views yet
InternVisionModel from InternVL.transformers (no ViTP repo needed):1from transformers import AutoModel, AutoImageProcessor
2import torch
3
4device = "cuda"
5model = AutoModel.from_pretrained(
6 "BiliSakura/ViTP-ViT-L-300M-General",
7 trust_remote_code=True,
8 torch_dtype=torch.bfloat16,
9 device_map=device,
10).eval()
11
12processor = AutoImageProcessor.from_pretrained("BiliSakura/ViTP-ViT-L-300M-General")
13pixel_values = processor(images="image.jpg", return_tensors="pt").pixel_values.to(device, model.dtype)
14
15with torch.no_grad():
16 outputs = model(pixel_values=pixel_values)
17
18# Pooled CLS token: (1, 1024)
19features = outputs.pooler_output
20# Or full sequence: outputs.last_hidden_state1@article{Li_2025_ViTP,
2 title={Visual Instruction Pretraining for Domain-Specific Foundation Models},
3 author={Li, Yuxuan and Zhang, Yicheng and Tang, Wenhao and Dai, Yimian and Cheng, Ming-Ming and Li, Xiang and Yang, Jian},
4 journal={arXiv},
5 year={2025}
6}