Views
No views yet
| Subset | BLEU |
|---|---|
| All (n=50) | 45.2 |
| Contaminated (n=16) | 73.3 |
| Clean (n=34) | 40.3 |
Important: The "All" and "Contaminated" BLEU scores are inflated due to target-side data contamination (32% of test targets appear in training). The Clean score represents genuine translation quality on decontaminated samples.
1from transformers import M2MForConditionalGeneration, M2MTokenizer
2
3model = M2MForConditionalGeneration.from_pretrained("bumblelbee/hiero-m2m100-doc-clean")
4tokenizer = M2MTokenizer.from_pretrained("bumblelbee/hiero-m2m100-doc-clean")
5
6# Gardiner notation input (hieroglyphic transliteration)
7source = "D36 N35 G17 D21 X1 O34"
8
9tokenizer.src_lang = "ea"
10inputs = tokenizer(source, return_tensors="pt")
11generated = model.generate(**inputs, forced_bos_token_id=tokenizer.get_lang_id("de"))
12output = tokenizer.decode(generated[0], skip_special_tokens=True)
13print(output)1@inproceedings{toutou-etal-2026-data,
2 title = {Data Contamination in Neural Hieroglyphic Translation:
3 A Reproducibility Study},
4 author = {Toutou, Ammar and Harb, Abdelrahman and Basta, Christine},
5 booktitle = {Proceedings of the 6th International Conference on
6 Natural Language Processing for Digital Humanities
7 (NLP4DH 2026)},
8 year = {2026},
9 address = {San Diego, USA},
10 publisher = {Association for Computational Linguistics},
11}