Views
No views yet
XLMRobertaForTokenClassification (XLM-RoBERTa-large, 24 couches,
1024 dimensions cachées) fine-tuné pour la classification de tokens en parties du
discours. Il a été obtenu à partir de Rziane/xlmr-large-kreyol-RHI,
un modèle de langue adapté au domaine du HC parlé par pré-entraînement continué de
XLM-RoBERTa (Conneau et al., 2020).ADJ, ADP, ADV, AUX, CCONJ, DET, INTJ, NOUN, NUM, PRON, PROPN,
SCONJ, VERB, X| Catégorie | Accuracy | Catégorie | Accuracy |
|---|---|---|---|
| AUX | 0.984 | DET | 0.949 |
| VERB | 0.992 | NOUN | 0.947 |
| CCONJ | 0.976 | PRON | 0.940 |
| SCONJ | 0.967 | ADJ | 0.841 |
| INTJ | 0.958 | ADV | 0.831 |
| NUM | 0.951 | PROPN | 0.831 |
| ADP | 0.938 | X | 0.875 |
1from transformers import AutoTokenizer, AutoModelForTokenClassification
2import torch
3
4model_id = "Rziane/xlmr-large-kreyol-RHI-pos"
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = AutoModelForTokenClassification.from_pretrained(model_id)
7model.eval()
8
9tokens = ["Mwen", "renmen", "lang", "kreyòl", "la"]
10enc = tokenizer(tokens, is_split_into_words=True, return_tensors="pt")
11with torch.no_grad():
12 logits = model(**enc).logits
13preds = logits.argmax(-1)[0]
14
15seen = set()
16for tok_idx, wid in enumerate(enc.word_ids()):
17 if wid is not None and wid not in seen:
18 seen.add(wid)
19 print(tokens[wid], "->", model.config.id2label[preds[tok_idx].item()])ADJ, ADV, PROPN) présentent une exactitude inférieure.