Views
No views yet
Salesforce/blip-image-captioning-base and produces captions like: "A photo of a car from the brand Audi." Then, a simple brand-extraction layer maps captions to the final brand prediction.https://huggingface.co/SIYAKSARES/fine-tuned-blip-for-car-brandsSalesforce/blip-image-captioning-base1from transformers import BlipProcessor, BlipForConditionalGeneration
2from PIL import Image
3
4processor = BlipProcessor.from_pretrained("SIYAKSARES/fine-tuned-blip-for-car-brands")
5model = BlipForConditionalGeneration.from_pretrained("SIYAKSARES/fine-tuned-blip-for-car-brands")
6
7image = Image.open("your_test_image.jpg").convert("RGB")
8inputs = processor(images=image, return_tensors="pt")
9generated_ids = model.generate(**inputs, num_beams=3, max_new_tokens=16)
10caption = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
11print("Generated caption:", caption)num_beams=1 (greedy decoding).@article{blip2022,
title={BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation},
author={Li, Junnan and Li, Dongxu and Xiong, Caiming and Hoi, Steven},
journal={ICML},
year={2022}
}