Views
No views yet
[LABEL] tags, robust to OCR noise (character-level errors from scanned documents).0↔O, 1↔l, dropped/duplicated characters), and a byte-level model sees and can
correct these directly, unlike subword-tokenized models.1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2
3tok = AutoTokenizer.from_pretrained("rachitpandey26/byt5-pii-masking-ocr")
4model = AutoModelForSeq2SeqLM.from_pretrained("rachitpandey26/byt5-pii-masking-ocr")
5
6text = "Dear Omer, call 0151 555 0192 or email omer@mail.com."
7inputs = tok(text, return_tensors="pt")
8out = model.generate(**inputs, max_length=1024, num_beams=1)
9print(tok.decode(out[0], skip_special_tokens=True))
10# -> "Dear [FIRSTNAME], call [PHONENUMBER] or email [EMAIL]."1text = (
2 "[TABLE]\n"
3 "[HDR] name | order_id | email | city\n"
4 "[ROW] Omer | 4471 | a@x.com | Berlin\n"
5 "[ROW] Sara | 9982 | b@y.com | Lyon\n"
6 "[TASK] identify PII columns\n"
7 "[ANSWER]"
8)
9inputs = tok(text, return_tensors="pt")
10out = model.generate(**inputs, max_length=256, num_beams=1)
11print(tok.decode(out[0], skip_special_tokens=True))
12# -> "name: FIRSTNAME\nemail: EMAIL" (non-PII columns omitted; "[NONE]" if none found)