Views
No views yet
pip install git+https://github.com/huggingface/transformers1from transformers import AutoProcessor, PaliGemmaForConditionalGeneration
2from PIL import Image
3import requests
4import torch
5
6model_id = "gokaygokay/sd3-long-captioner-v2"
7
8url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/transformers/tasks/car.jpg?download=true"
9image = Image.open(requests.get(url, stream=True).raw)
10
11model = PaliGemmaForConditionalGeneration.from_pretrained(model_id).eval()
12processor = AutoProcessor.from_pretrained(model_id)
13
14## prefix
15prompt = "caption en"
16model_inputs = processor(text=prompt, images=image, return_tensors="pt")
17input_len = model_inputs["input_ids"].shape[-1]
18
19with torch.inference_mode():
20 generation = model.generate(**model_inputs, repetition_penalty=1.10, max_new_tokens=256, do_sample=False)
21 generation = generation[0][input_len:]
22 decoded = processor.decode(generation, skip_special_tokens=True)
23 print(decoded)
24 1@software{aydogan2024sd3_long_captioner_v2,
2 author = {Aydoğan, Gökay},
3 title = {{sd3-long-captioner-v2}},
4 year = {2024},
5 publisher = {Hugging Face},
6 url = {https://huggingface.co/gokaygokay/sd3-long-captioner-v2},
7 note = {Model repository; cite the base model and upstream datasets as required.}
8}