Views
No views yet
1from sentence_transformers import CrossEncoder
2
3
4query = "על מה לא הסכים דוד בן גוריון לוותר?"
5doc1 = """
6מלחמת סיני הסתיימה בתבוסה של הכוחות המצריים, אך ברית המועצות וארצות הברית הפעילו לחץ כבד על ישראל לסגת מחצי האי סיני.
7ראש ממשלת ישראל, דוד בן-גוריון, הסכים, בעקבות הלחץ של שתי המעצמות,
8לפנות את חצי האי סיני ורצועת עזה בתהליך שהסתיים במרץ 1957,
9אך הודיע שסגירה של מצרי טיראן לשיט ישראלי תהווה עילה למלחמה.
10ארצות הברית התחייבה לדאוג להבטחת חופש המעבר של ישראל במצרי טיראן.
11כוח חירום בינלאומי של האו"ם הוצב בצד המצרי של הגבול עם ישראל ובשארם א-שייח' וכתוצאה מכך נשאר נתיב השיט במפרץ אילת פתוח לשיט הישראלי.
12"""
13doc2 = """
14ים סוף מהווה מוקד חשוב לתיירות מרחבי העולם.
15מזג האוויר הנוח בעונת החורף, החופים היפים, הים הצלול ואתרי הצלילה המרהיבים לחופי סיני,
16מצרים, וסודאן הופכים את חופי ים סוף ליעד תיירות מבוקש.
17ראס מוחמד והחור הכחול בסיני, ידועים כאתרי צלילה מהמרהיבים בעולם.
18מאז הסכם השלום בין ישראל למצרים פיתחה מצרים מאוד את התיירות לאורך חופי ים סוף,
19ובמיוחד בסיני, ובנתה עשרות אתרי תיירות ומאות מלונות וכפרי נופש.
20תיירות זו נפגעה קשות מאז המהפכה של 2011 במצרים,
21עם עלייה חדה בתקריות טרור מצד ארגונים אסלאמיים קיצוניים בסיני.
22"""
23
24model = CrossEncoder("haguy77/dictabert-ce")
25
26scores = model.predict([[query, doc1], [query, doc2]]) # Note: query should ALWAYS be the first of each pair
27# array([0.02000629, 0.00031683], dtype=float32)
28
29results = model.rank(query, [doc2, doc1])
30# [{'corpus_id': 1, 'score': 0.020006292}, {'corpus_id': 0, 'score': 0.00031683326}]1@misc{shmidman2023dictabert,
2 title={DictaBERT: A State-of-the-Art BERT Suite for Modern Hebrew},
3 author={Shaltiel Shmidman and Avi Shmidman and Moshe Koppel},
4 year={2023},
5 eprint={2308.16687},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL}
8}1@inproceedings{cohen2023heq,
2 title={Heq: a large and diverse hebrew reading comprehension benchmark},
3 author={Cohen, Amir and Merhav-Fine, Hilla and Goldberg, Yoav and Tsarfaty, Reut},
4 booktitle={Findings of the Association for Computational Linguistics: EMNLP 2023},
5 pages={13693--13705},
6 year={2023}
7}1Shmidman, S., Shmidman, A., & Koppel, M. (2023). DictaBERT: A State-of-the-Art BERT Suite for Modern Hebrew. arXiv preprint arXiv:2308.16687.
2
3Cohen, A., Merhav-Fine, H., Goldberg, Y., & Tsarfaty, R. (2023, December). Heq: a large and diverse hebrew reading comprehension benchmark. In Findings of the Association for Computational Linguistics: EMNLP 2023 (pp. 13693-13705).