Views
No views yet
1from transformers import AutoModelForMaskedLM, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained('dicta-il/dictabert-splinter', trust_remote_code=True)
4model = AutoModelForMaskedLM.from_pretrained('dicta-il/dictabert-splinter')
5
6model.eval()
7
8sentence = 'בשנת 1948 השלים אפרים קישון את [MASK] בפיסול מתכת ובתולדות האמנות והחל לפרסם מאמרים הומוריסטיים'
9
10output = model(tokenizer.encode(sentence, return_tensors='pt'))
11# the [MASK] is the 7th token (including [CLS])
12import torch
13top_2 = torch.topk(output.logits[0, 7, :], 2)[1]
14print('\n'.join(tokenizer.batch_decode(top_2))) # should print התמחותו / לימודיו
15Splintering Nonconcatenative Languages for Better Tokenization1@misc{gazit2025splinteringnonconcatenativelanguagesbetter,
2 title={Splintering Nonconcatenative Languages for Better Tokenization},
3 author={Bar Gazit and Shaltiel Shmidman and Avi Shmidman and Yuval Pinter},
4 year={2025},
5 eprint={2503.14433},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL},
8 url={https://arxiv.org/abs/2503.14433},
9}