Views
No views yet
pip install -U -q keras-hub
pip install -U -q keras
| Preset | Architecture | Vision Encoder | Language Model | Description |
|---|---|---|---|---|
blip2_opt_2.7b | BLIP-2 | EVA-CLIP ViT-g/14 | OPT-2.7B | BLIP-2 model using OPT-2.7B as the frozen language model. |
blip2_opt_6.7b | BLIP-2 | EVA-CLIP ViT-g/14 | OPT-6.7B | BLIP-2 model using OPT-6.7B as the frozen language model. |
blip2_flan_t5_xl | BLIP-2 | EVA-CLIP ViT-g/14 | Flan-T5-XL | BLIP-2 model using Flan-T5-XL (~3B) as the frozen language model. |
blip2_flan_t5_xxl | BLIP-2 | EVA-CLIP ViT-g/14 | Flan-T5-XXL | BLIP-2 model using Flan-T5-XXL (~11B) as the frozen language model. |
BLIP2CausalLM (for OPT models) or BLIP2Seq2SeqLM (for Flan-T5 models).BLIP2Seq2SeqLM class supports BLIP-2 variants that use Flan-T5 as their base language model. This architecture requires passing your text prompt to the encoder using the "encoder_text" key.1import keras
2import keras_hub
3import numpy as np
4from PIL import Image
5import requests
6
7model = keras_hub.models.BLIP2Seq2SeqLM.from_preset("blip2_flan_t5_xl")
8
9image_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/bee.jpg"
10image = Image.open(requests.get(image_url, stream=True).raw).convert("RGB")
11image_array = np.array(image)
12
13vqa_input = {
14 "images": image_array,
15 "encoder_text": ["Question: what is in the picture? Answer:"]
16}
17print(model.generate(vqa_input))
18
19caption_input = {
20 "images": image_array,
21 "encoder_text": ["A picture of"]
22}
23print(model.generate(caption_input))BLIP2CausalLM (for OPT models) or BLIP2Seq2SeqLM (for Flan-T5 models).BLIP2Seq2SeqLM class supports BLIP-2 variants that use Flan-T5 as their base language model. This architecture requires passing your text prompt to the encoder using the "encoder_text" key.1import keras
2import keras_hub
3import numpy as np
4from PIL import Image
5import requests
6
7model = keras_hub.models.BLIP2Seq2SeqLM.from_preset("hf://keras/blip2_flan_t5_xl")
8
9image_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/bee.jpg"
10image = Image.open(requests.get(image_url, stream=True).raw).convert("RGB")
11image_array = np.array(image)
12
13vqa_input = {
14 "images": image_array,
15 "encoder_text": ["Question: what is in the picture? Answer:"]
16}
17print(model.generate(vqa_input))
18
19caption_input = {
20 "images": image_array,
21 "encoder_text": ["A picture of"]
22}
23print(model.generate(caption_input))