Views
No views yet
| NLTK | spaCy | This model | |
|---|---|---|---|
| Macro F1 | 0.9411 | 0.9519 | 0.9863 |
1git clone https://github.com/LucaTamSapienza/sentence_splitter.git
2cd sentence_splitter
3pip install -r requirements.txt
4python download_model.py
5python src/predict.py --input input/ --output output/ --model_path checkpoints/best_xlmr_model.ptXLM-RoBERTa-large -> Dropout(0.1) -> Linear(1024, 1) -> per-token sigmoid@misc{tam2026sentencesplitter,
author = {Luca Tam},
title = {Sentence Splitter: Fine-tuning XLM-RoBERTa for Sentence Boundary Detection},
year = {2026},
url = {https://github.com/LucaTamSapienza/sentence_splitter}
}