Views
No views yet
1from transformers import pipeline
2
3classifier = pipeline("text-classification", model="AdaMLLab/XLM-RoBERTa-Arabic-Quality-Classifier")
4result = classifier("النص العربي هنا")1@misc{messmer2025fineweb2hq,
2 title={Enhancing Multilingual LLM Pretraining with Model-Based Data Selection},
3 author={Bettina Messmer and Vinko Sabolčec and Martin Jaggi},
4 year={2025},
5 eprint={2502.10361},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL},
8 url={https://arxiv.org/abs/2502.10361},
9}
10
11@misc{alrashed2025mixminmatch,
12 title={Mix, MinHash, and Match: Cross-Source Agreement for Multilingual Pretraining Datasets},
13 author={Sultan Alrashed and Francesco Orabona},
14 year={2025},
15 eprint={2512.18834v2},
16 archivePrefix={arXiv},
17 primaryClass={cs.CL},
18 url={https://arxiv.org/abs/2512.18834v2},
19}