Fine-tuned
DETR (ResNet-50) for detecting layout regions in historical newspaper
page scans, trained on
biglam/loc_beyond_words
(2,846 train / 712 validation images, 7 classes).
Photograph, Illustration, Map, Comics/Cartoon, Editorial Cartoon, Headline, Advertisement
1from transformers import DetrImageProcessor, DetrForObjectDetection
2from PIL import Image
3import torch
4
5processor = DetrImageProcessor.from_pretrained("harness-race/pi-r2")
6model = DetrForObjectDetection.from_pretrained("harness-race/pi-r2")
7
8image = Image.open("page.png").convert("RGB")
9inputs = processor(images=image, return_tensors="pt")
10with torch.no_grad():
11 outputs = model(**inputs)
12
13results = processor.post_process_object_detection(
14 outputs, threshold=0.5, target_sizes=[(image.height, image.width)])[0]
15for score, label, box in zip(results["scores"], results["labels"], results["boxes"]):
16 print(model.config.id2label[label.item()], round(score.item(), 3), [round(v, 1) for v in box.tolist()])