This model is a fine-tuned version of
xlm-roberta-base for cross-lingual spam detection. It was trained on
English and
Hindi messages, and evaluated on
German samples. The goal is to demonstrate zero-shot transfer in spam/ham classification across languages.
1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2import torch
3
4model_name = "Xtiphyn/Cross-Lingual-Spam-Filter"
5tokenizer = AutoTokenizer.from_pretrained(model_name)
6model = AutoModelForSequenceClassification.from_pretrained(model_name)
7
8inputs = tokenizer("Sie haben eine kostenlose Reise gewonnen!", return_tensors="pt")
9with torch.no_grad():
10 logits = model(**inputs).logits
11 prediction = torch.argmax(logits).item()
12
13print("Label:", "Spam" if prediction == 1 else "Ham")
14
15
16🛠️ Environment
17Transformers: 4.54.0
18
19PyTorch: 2.6.0+cu124
20
21Datasets: 4.0.0
22
23Tokenizers: 0.21.2
24
25🚧 Future Work
26Incorporate code-switching and low-resource scripts
27
28Made with ❤️ by Xtiphyn.