This dataset contains conversational visual question answering (VQA) dialogues structured specifically for fine-tuning on-device multimodal Vision-Language Models (VLMs), such as Gemma 4 E4B Vision/Audio.
The dataset is compiled from the Skin Condition Image Network (SCIN) cohort, cleansing conflicts and joining raw patient-reported demographics, symptoms, and Fitzpatrick/Monk skin tones.