Views
No views yet
laion/CLIP-ViT-H-14-laion2B-s32B-b79K. The image encoder is finetuned with FARE at $\epsilon=2/255$. The text encoder is finetuned with LEAF at $k=1$ with $\rho=50$ and semantic constraints.1from transformers import CLIPProcessor, CLIPModel
2
3model_name = "LEAF-CLIP/OpenCLIP-ViT-H-rho50-k1-constrained-FARE2"
4processor_name = "laion/CLIP-ViT-H-14-laion2B-s32B-b79K"
5
6model = CLIPModel.from_pretrained(model_name)
7processor = CLIPProcessor.from_pretrained(processor_name)