Views
No views yet
PubMedCLIP — a CLIP variant pre-trained on radiology images from the ROCO dataset — and adapts it for Glioma tumor classification using supervised fine-tuning (SFT) with Low-Rank Adaptation (LoRA) and 8-bit quantization.flaviagiammarino/pubmed-clip-vit-base-patch32bitsandbytesparthsalke/vlm_glioma_dataset| Component | Strategy |
|---|---|
| Vision Encoder | Frozen base, LoRA adapters (qkv) |
| Text Encoder | Frozen base, LoRA adapters |
| Training Method | Supervised Fine-Tuning (SFT) |
| Optimizer | AdamW |
| LoRA Params | r=8, alpha=32, dropout=0.1 |
| Precision | 8-bit (bnb + PEFT) |
1from transformers import CLIPProcessor
2from peft import PeftModel
3from PIL import Image
4
5# Load base + LoRA adapter
6from transformers import CLIPModel
7base = CLIPModel.from_pretrained("flaviagiammarino/pubmed-clip-vit-base-patch32")
8model = PeftModel.from_pretrained(base, "parthsalke/biomedclip-glioma-lora-8bit")
9
10# Load processor
11processor = CLIPProcessor.from_pretrained("flaviagiammarino/pubmed-clip-vit-base-patch32")
12
13# Inference example
14image = Image.open("example.png").convert("RGB")
15text = [" ", " "] #Input labels here
16
17inputs = processor(images=image, text=text, return_tensors="pt", padding=True)
18outputs = model(**inputs)
19probs = outputs.logits_per_image.softmax(dim=1)