Views
No views yet
akpsahan/Blabela-1.5V. The standard safety guardrails and alignment filters have been removed or modified to allow for unrestricted outputs.image-text-to-text pipeline, allowing it to process both images and text inputs simultaneously to generate text-based answers, image captions, and visual analysis.transformers library. (Note: Adjust the processor and model classes if Blabela-1.5V uses a specific architecture like LLaVA or Qwen-VL).1from transformers import AutoProcessor, AutoModelForCausalLM
2from PIL import Image
3import requests
4
5# Replace with your actual Hugging Face model repository name
6model_id = "your-username/your-model-name"
7
8processor = AutoProcessor.from_pretrained(model_id)
9model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")
10
11# Load an image
12image_url = "[https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/transformers/tasks/car.jpg?download=true](https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/transformers/tasks/car.jpg?download=true)"
13image = Image.open(requests.get(image_url, stream=True).raw)
14
15# Define your prompt
16prompt = "Describe what is happening in this image."
17
18# Prepare inputs
19inputs = processor(text=prompt, images=image, return_tensors="pt").to(model.device)
20
21# Generate response
22outputs = model.generate(**inputs, max_new_tokens=150)
23generated_text = processor.decode(outputs[0], skip_special_tokens=True)
24
25print(generated_text)