Views
No views yet
⚠️ Notă importantă despre utilizare: Modelul singur (IID F1=1.0) suferă de stylistic fingerprint cross-sursă (LOSO-V recall 29.35% — drop de 70.65pp). În sistemul final, decizia vine de la Modulul 3 (similaritate semantică, F1=0.9454, LOSO-V drop doar 7.7pp). Utilizați acest model doar ca parte a pipeline-ului complet, disponibil pe GitHub.
1from transformers import pipeline
2
3classifier = pipeline(
4 "text-classification",
5 model="rares127/xlmr-dezinformare-ro"
6)
7
8text = "Articolul de analizat în limba română..."
9result = classifier(text)
10# Exemplu output:
11# [{'label': 'stire_credibila', 'score': 0.987}]
12# [{'label': 'dezinformare_pro_rusa', 'score': 0.994}]Limită: modelul procesează maxim 256 tokens (~1500 caractere). Articolele mai lungi sunt trunchiate automat de tokenizer.
| Label | ID | Sursă de antrenare |
|---|---|---|
stire_credibila | 0 | G4Media.ro, Digi24.ro |
dezinformare_pro_rusa | 1 | Veridica.ro, Stopfals.md |
| Parametru | Valoare |
|---|---|
| Model de bază | xlm-roberta-base |
| Task | Clasificare binară (sequence classification) |
| Loss | CrossEntropyLoss cu ponderi de clasă (WeightedTrainer) |
| Optimizer | AdamW |
| EarlyStopping | patience=2 pe validation F1 |
| Split | 70% train / 15% val / 15% test (stratificat pe sursă) |
| Hardware | Apple M2 Pro / Google Colab T4 (~4 min) |
| Metrică | Valoare |
|---|---|
| Macro F1 | 1.000 |
| Accuracy | 99.07% |
| Precision cls1 | 100% |
| Recall cls1 | 100% |
| Metrică | Valoare |
|---|---|
| Recall cls1 | 29.35% |
| Drop față de IID | −70.65 pp |
rares127/dezinformare-ro:
1.483 articole (746 dezinformare / 737 credibile), perioada 2022–2026.