Caption-Anything-InContext is a dataset curated using the model Caption-Pro for improved in-context captioning of images. This model is designed for generating multiple captions for images, ensuring they are contextually accurate.
Demo with transformers
import os
import gdown
import torch
from transformers import Qwen2VLForConditionalGeneration, AutoProcessor
from qwen_vl_utils import process_vision_info
from PIL import… See the full description on the dataset page:
https://huggingface.co/datasets/prithivMLmods/Caption-Anything-InContext.