Views
No views yet
google/gemma-3-4b-it using the BiGemma3 architecture.1import torch
2from colpali_engine.models import BiGemma3, BiGemmaProcessor3
3
4# Load model and processor
5model = BiGemma3.from_pretrained(
6 "Nayana-cognitivelab/bigemma",
7 torch_dtype=torch.bfloat16,
8 device_map="auto",
9 trust_remote_code=True,
10)
11processor = BiGemmaProcessor3.from_pretrained("Nayana-cognitivelab/bigemma")
12
13# Process inputs
14images = [Image.open("doc.png")]
15batch_images = processor.process_images(images).to(model.device)
16
17# Generate embeddings
18with torch.no_grad():
19 embeddings = model(**batch_images, pooling_strategy="last", embedding_dim=2560)
20
21print(embeddings.shape) # (1, 2560)1@misc{colpali2024,
2 title={ColPali: Efficient Document Retrieval with Vision Language Models},
3 author={Manuel Faysse et al.},
4 year={2024},
5}