LoRA adapter for
HuggingFaceTB/SmolVLM2-2.2B-Instruct,
fine-tuned for Bengali Visual Question Answering on the
Bangla-Bayanno dataset.
Trained on a single Colab T4 GPU (16GB) with a constrained time/step budget (LoRA r=16,
False QLoRA, fp16, image-splitting disabled for speed).
1from transformers import AutoProcessor, AutoModelForImageTextToText
2from peft import PeftModel
3import torch
4
5base = AutoModelForImageTextToText.from_pretrained(
6 "HuggingFaceTB/SmolVLM2-2.2B-Instruct", torch_dtype=torch.float16
7)
8model = PeftModel.from_pretrained(base, "bhaskar1707/smolvlm2-bangla-bayanno-lora")
9processor = AutoProcessor.from_pretrained("bhaskar1707/smolvlm2-bangla-bayanno-lora", do_image_splitting=False)