Views
No views yet
1
2from PIL import Image
3import torch
4from transformers import PaliGemmaProcessor, PaliGemmaForConditionalGeneration, BitsAndBytesConfig, TrainingArguments, Trainer
5
6
7model = PaliGemmaForConditionalGeneration.from_pretrained('NYUAD-ComNets/FaceScanPaliGemma_Age',torch_dtype=torch.bfloat16)
8
9input_text = "what is the age group of the person in the image?"
10
11processor = PaliGemmaProcessor.from_pretrained("google/paligemma-3b-pt-224")
12
13device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
14
15model.to(device)
16
17
18input_image = Image.open('image_path')
19inputs = processor(text=input_text, images=input_image, padding="longest", do_convert_rgb=True, return_tensors="pt").to(device)
20inputs = inputs.to(dtype=model.dtype)
21
22with torch.no_grad():
23 output = model.generate(**inputs, max_length=500)
24result=processor.decode(output[0], skip_special_tokens=True)[len(input_text):].strip()
25
26@article{aldahoul2026facescanpaligemma,
title={FaceScanPaliGemma multi-agent vision language models for facial attribute recognition},
author={AlDahoul, Nouar and Tan, Myles Joshua Toledo and Kasireddy, Harishwar Reddy and Zaki, Yasir},
journal={Scientific Reports},
year={2026},
publisher={Nature Publishing Group UK London}
}
@article{aldahoul2024exploring,
title={Exploring Vision Language Models for Facial Attribute Recognition: Emotion, Race, Gender, and Age},
author={AlDahoul, Nouar and Tan, Myles Joshua Toledo and Kasireddy, Harishwar Reddy and Zaki, Yasir},
journal={arXiv preprint arXiv:2410.24148},
year={2024}
}
@misc{ComNets,
url={https://huggingface.co/NYUAD-ComNets/FaceScanPaliGemma_Age](https://huggingface.co/NYUAD-ComNets/FaceScanPaliGemma_Age)},
title={FaceScanPaliGemma_Age},
author={Nouar AlDahoul, Yasir Zaki}
}