Finetuned from model: unsloth/qwen2-vl-7b-instruct-bnb-4bit
Dataset used: PubMed Vision Dataset
Training Samples: 6666
Model type: Text + Image multimodal model
This model was fine-tuned on the PubMed Vision dataset using 6666 training samples, combining text and image inputs to enhance its multimodal understanding capabilities.