Views
No views yet
1from transformers import AutoModel, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained('dicta-il/BEREL-seg')
4model = AutoModel.from_pretrained('dicta-il/BEREL-seg', trust_remote_code=True)
5
6model.eval()
7
8sentence = 'וזה לשון הרמב״ן בפירושו על התורה, שהדבר ידוע ומפורסם לכל בעלי העיון שאין המקרא יוצא מידי פשוטו אף על פי שהדרש אמת.'
9
10print(model.predict([sentence], tokenizer))1[
2 [
3 [ "[CLS]" ],
4 [ "ו", "זה" ],
5 [ "לשון" ],
6 [ "ה", "רמב\"ן" ],
7 [ "ב", "פירושו" ],
8 [ "על" ],
9 [ "ה", "תורה" ],
10 [ ", " ],
11 [ "שהד", "בר" ],
12 [ "ידוע" ],
13 [ "ו", "מפורסם" ],
14 [ "ל", "כל" ],
15 [ "בעלי" ],
16 [ "ה", "עיון" ],
17 [ "ש", "אין" ],
18 [ "ה", "מקרא" ],
19 [ "יוצא" ],
20 [ "פשוטו" ],
21 [ "אף" ],
22 [ "על" ],
23 [ "פי" ],
24 [ "שהד", "רש" ],
25 [ "אמת" ],
26 [ "." ],
27 [ "[SEP]" ]
28 ]
29]tbdtbd