Views
No views yet
<MORE_DETAILED_CAPTION> task so that, given an image, it produces a detailed descriptive caption written in Khmer.peft)<MORE_DETAILED_CAPTION>| Split | Rows |
|---|---|
| train | 3,690 |
| val | 977 |
| test | 978 |
<MORE_DETAILED_CAPTION>1import torch
2from transformers import AutoProcessor, AutoModelForCausalLM
3from peft import PeftModel
4from PIL import Image
5
6base_model_id = "microsoft/Florence-2-base"
7adapter_id = "phonsobon/Images_captioning_fine_tune_Florence-2-base"
8
9processor = AutoProcessor.from_pretrained(adapter_id, trust_remote_code=True)
10base_model = AutoModelForCausalLM.from_pretrained(base_model_id, trust_remote_code=True, torch_dtype=torch.float32)
11model = PeftModel.from_pretrained(base_model, adapter_id)
12model.eval()
13
14image = Image.open("your_image.jpg").convert("RGB")
15task_prompt = "<MORE_DETAILED_CAPTION>"
16
17inputs = processor(text=task_prompt, images=image, return_tensors="pt")
18generated_ids = model.generate(
19 input_ids=inputs["input_ids"],
20 pixel_values=inputs["pixel_values"],
21 max_new_tokens=1024,
22 num_beams=3,
23 do_sample=False,
24)
25generated_text = processor.batch_decode(generated_ids, skip_special_tokens=False)[0]
26caption = processor.post_process_generation(
27 generated_text, task=task_prompt, image_size=(image.width, image.height)
28)[task_prompt]
29
30print(caption)1@article{xiao2023florence2,
2 title={Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks},
3 author={Xiao, Bin and Wu, Haiping and Xu, Weijian and Dai, Xiyang and Hu, Houdong and Lu, Yumao and Zeng, Michael and Liu, Ce and Yuan, Lu},
4 journal={arXiv preprint arXiv:2311.06242},
5 year={2023}
6}