Views
No views yet

Language models, including Flan-T5, can potentially be used for language generation in a harmful way, according to Rae et al. (2021). Flan-T5 should not be used directly in any application, without a prior assessment of safety and fairness concerns specific to the application.
1import requests
2from PIL import Image
3from transformers import BlipProcessor, Blip2ForConditionalGeneration
4
5processor = BlipProcessor.from_pretrained("Salesforce/blip2-flan-t5-xxl")
6model = Blip2ForConditionalGeneration.from_pretrained("Salesforce/blip2-flan-t5-xxl")
7
8img_url = 'https://storage.googleapis.com/sfr-vision-language-research/BLIP/demo.jpg'
9raw_image = Image.open(requests.get(img_url, stream=True).raw).convert('RGB')
10
11question = "how many dogs are in the picture?"
12inputs = processor(raw_image, question, return_tensors="pt")
13
14out = model.generate(**inputs)
15print(processor.decode(out[0], skip_special_tokens=True))1# pip install accelerate
2import requests
3from PIL import Image
4from transformers import Blip2Processor, Blip2ForConditionalGeneration
5
6processor = Blip2Processor.from_pretrained("Salesforce/blip2-flan-t5-xxl")
7model = Blip2ForConditionalGeneration.from_pretrained("Salesforce/blip2-flan-t5-xxl", device_map="auto")
8
9img_url = 'https://storage.googleapis.com/sfr-vision-language-research/BLIP/demo.jpg'
10raw_image = Image.open(requests.get(img_url, stream=True).raw).convert('RGB')
11
12question = "how many dogs are in the picture?"
13inputs = processor(raw_image, question, return_tensors="pt").to("cuda")
14
15out = model.generate(**inputs)
16print(processor.decode(out[0], skip_special_tokens=True))float16)1# pip install accelerate
2import torch
3import requests
4from PIL import Image
5from transformers import Blip2Processor, Blip2ForConditionalGeneration
6
7processor = Blip2Processor.from_pretrained("Salesforce/blip2-flan-t5-xxl")
8model = Blip2ForConditionalGeneration.from_pretrained("Salesforce/blip2-flan-t5-xxl", torch_dtype=torch.float16, device_map="auto")
9
10img_url = 'https://storage.googleapis.com/sfr-vision-language-research/BLIP/demo.jpg'
11raw_image = Image.open(requests.get(img_url, stream=True).raw).convert('RGB')
12
13question = "how many dogs are in the picture?"
14inputs = processor(raw_image, question, return_tensors="pt").to("cuda", torch.float16)
15
16out = model.generate(**inputs)
17print(processor.decode(out[0], skip_special_tokens=True))int8)1# pip install accelerate bitsandbytes
2import torch
3import requests
4from PIL import Image
5from transformers import Blip2Processor, Blip2ForConditionalGeneration
6
7processor = Blip2Processor.from_pretrained("Salesforce/blip2-flan-t5-xxl")
8model = Blip2ForConditionalGeneration.from_pretrained("Salesforce/blip2-flan-t5-xxl", load_in_8bit=True, device_map="auto")
9
10img_url = 'https://storage.googleapis.com/sfr-vision-language-research/BLIP/demo.jpg'
11raw_image = Image.open(requests.get(img_url, stream=True).raw).convert('RGB')
12
13question = "how many dogs are in the picture?"
14inputs = processor(raw_image, question, return_tensors="pt").to("cuda", torch.float16)
15
16out = model.generate(**inputs)
17print(processor.decode(out[0], skip_special_tokens=True))