Views
No views yet
answerdotai/ModernBERT-base using only the Turkish part of CulturaX.answerdotai/ModernBERT-base| Dataset & Mask Level | Artiwise Modern Bert | ytu-ce-cosmos/turkish-base-bert-uncased | dbmdz/bert-base-turkish-uncased |
|---|---|---|---|
| QA Dataset (5% mask) | 74.50 | 60.84 | 48.57 |
| QA Dataset (10% mask) | 72.18 | 58.75 | 46.29 |
| QA Dataset (15% mask) | 69.46 | 56.50 | 44.30 |
| Review Dataset (5% mask) | 62.67 | 48.57 | 35.38 |
| Review Dataset (10% mask) | 59.60 | 45.77 | 33.04 |
| Review Dataset (15% mask) | 56.51 | 43.05 | 31.05 |
| Biomedical Dataset (5% mask) | 58.11 | 50.78 | 40.82 |
| Biomedical Dataset (10% mask) | 55.55 | 48.37 | 38.51 |
| Biomedical Dataset (15% mask) | 52.71 | 45.82 | 36.44 |
do_lower_case = True flag with the tokenizer. Instead, convert your text to lower case as follows:text.replace("I", "ı").lower()1from transformers import AutoTokenizer, AutoModelForMaskedLM
2import torch
3
4# Load the model and tokenizer
5tokenizer = AutoTokenizer.from_pretrained("artiwise-ai/modernbert-base-tr-uncased")
6model = AutoModelForMaskedLM.from_pretrained("artiwise-ai/modernbert-base-tr-uncased")
7
8# Example sentence with masked token
9text = "Türkiye'nin başkenti [MASK]'dır."
10text.replace("I", "ı").lower()
11
12# Tokenize and prepare input
13inputs = tokenizer(text, return_tensors="pt")
14
15# Get the position of the masked token
16mask_token_index = torch.where(inputs["input_ids"] == tokenizer.mask_token_id)[1]
17
18# Forward pass
19with torch.no_grad():
20 outputs = model(**inputs)
21
22# Get the predictions for the masked token
23logits = outputs.logits
24mask_token_logits = logits[0, mask_token_index, :]
25top_5_tokens = torch.topk(mask_token_logits, 5, dim=1).indices[0].tolist()
26
27# Print the predictions
28print(f"Original text: {text}")
29print("Top 5 predictions for [MASK]:")
30for token in top_5_tokens:
31 print(f"- {tokenizer.decode([token])}")
32