Views
No views yet
| Original Class Names | New Class Names |
|---|---|
| Caption | Cap |
| Footnote | Footnote |
| Formula | Math |
| List-item | List |
| Page-footer | Bottom |
| Page-header | Header |
| Picture | Picture |
| Section-header | Section |
| Table | Table |
| Text | Text |
| Title | Title |
1import requests
2from PIL import Image
3from transformers import AutoProcessor, AutoModelForCausalLM
4model = AutoModelForCausalLM.from_pretrained("yifeihu/Florence-2-DocLayNet-Fixed", trust_remote_code=True)
5processor = AutoProcessor.from_pretrained("yifeihu/Florence-2-DocLayNet-Fixed", trust_remote_code=True)
6prompt = "<OD>"
7url = "https://huggingface.co/yifeihu/TF-ID-base/resolve/main/arxiv_2305_10853_5.png?download=true"
8image = Image.open(requests.get(url, stream=True).raw)
9inputs = processor(text=prompt, images=image, return_tensors="pt")
10generated_ids = model.generate(
11 input_ids=inputs["input_ids"],
12 pixel_values=inputs["pixel_values"],
13 max_new_tokens=1024,
14 do_sample=False,
15 num_beams=3
16)
17generated_text = processor.batch_decode(generated_ids, skip_special_tokens=False)[0]
18parsed_answer = processor.post_process_generation(generated_text, task="<OD>", image_size=(image.width, image.height))
19print(parsed_answer)@misc{TF-ID,
author = {Yifei Hu},
title = {TF-ID: Table/Figure IDentifier for academic papers},
year = {2024},
publisher = {GitHub},
journal = {GitHub repository},
howpublished = {\url{https://github.com/ai8hyf/TF-ID}},
}
@article{doclaynet2022,
title = {DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis},
doi = {10.1145/3534678.353904},
url = {https://arxiv.org/abs/2206.01062},
author = {Pfitzmann, Birgit and Auer, Christoph and Dolfi, Michele and Nassar, Ahmed S and Staar, Peter W J},
year = {2022}
}