Views
No views yet

Orig: Antistes mihi milibus trecentis.
OCR: Antiftes mihi milibus trecentis: " . .. .ijiscnn p inr: h
^ ^^^^^^^^^^^^^^^^^^^^^^^^^^
Orig: Cognoscenda virtute circumscripta est scientia, quae ad experientiam pertinet et ad rationem.
OCR: C0gn0fccndauirtutccircurnfcriptacftfcientia:quacadcxpcricntiarnpcrtinct&adrationcrn«
^ ^^^^ ^ ^^ ^^^ ^ ^^^^ ^ ^^^ ^ ^ ^^ ^ ^ ^ ^^^^1import torch
2from transformers import AutoModel, AutoTokenizer
3
4device = "cuda"
5
6model_repo = "aimgo/CaputEmendatoris"
7tokenizer_repo = "aimgo/Emendator"
8
9tokenizer = AutoTokenizer.from_pretrained(tokenizer_repo)
10
11model = AutoModel.from_pretrained(
12 model_repo,
13 trust_remote_code=True, # <=== NECESSARY, THIS HEAD HAS A CUSTOM MODELING FILE
14 torch_dtype=torch.bfloat16 if device == "cuda" else torch.float32,
15).to(device)
16
17model.eval()
18
19text = "quandoquidcrn natura anirni rnortalis habctur."
20
21enc = tokenizer(text, return_tensors="pt").to(device)
22
23# detector
24with torch.no_grad():
25 probs = model.detect(enc["input_ids"],enc.get("attention_mask", None))
26
27byte_probs = probs[0][:-1].detach().cpu().tolist()
28
29char_probs = []
30byte_idx = 0
31for c in text:
32 n = len(c.encode("utf-8"))
33 if byte_idx + n <= len(byte_probs):
34 char_probs.append(max(byte_probs[byte_idx:byte_idx+n]))
35 else:
36 char_probs.append(0.0)
37 byte_idx += n
38
39print(char_probs)@misc{mccarthy2026Emendator,
author = {McCarthy, A. M.},
title = {{Emendator}: Latin OCR Artifact Correction},
year = {2026},
howpublished = {\url{https://huggingface.co/aimgo/CaputEmendatoris}},
note = {Model}
}