Views
No views yet
| Model | Training Domain PPL | Unseen Text PPL |
|---|---|---|
| AssameseRoBERTa (Ours) | 1.7819 | 2.5332 |
| Assamese-BERT | 48.8211 | 12.5911 |
| MuRIL | 85.7272 | 8.7032 |
| mBERT | 26.7085 | 18.1564 |
| IndicBERT | 3194.1843 | 595.4611 |
| AxomiyaBERTa | 83615627.1696 | 30861455.2924 |
<s>, </s>, <pad>, <unk>, <mask>1from transformers import AutoTokenizer, AutoModelForMaskedLM
2
3tokenizer = AutoTokenizer.from_pretrained("MWirelabs/assamese-roberta")
4model = AutoModelForMaskedLM.from_pretrained("MWirelabs/assamese-roberta")
5
6text = "অসম হৈছে [MASK] এখন সুন্দৰ ৰাজ্য।"
7inputs = tokenizer(text, return_tensors="pt")
8outputs = model(**inputs)
9
10masked_index = (inputs.input_ids == tokenizer.mask_token_id).nonzero(as_tuple=True)[1]
11predicted_token_id = outputs.logits[0, masked_index].argmax(-1)
12predicted_token = tokenizer.decode(predicted_token_id)
13
14print("Predicted:", predicted_token)1from transformers import AutoTokenizer, AutoModel
2import torch
3
4tokenizer = AutoTokenizer.from_pretrained("MWirelabs/assamese-roberta")
5model = AutoModel.from_pretrained("MWirelabs/assamese-roberta")
6
7text = "অসমীয়া ভাষা অতি সুন্দৰ।"
8inputs = tokenizer(text, return_tensors="pt")
9
10with torch.no_grad():
11 outputs = model(**inputs)
12 embeddings = outputs.last_hidden_state
13
14print(f"Embeddings shape: {embeddings.shape}")1@misc{assamese-roberta-2025,
2 author = {MWire Labs},
3 title = {AssameseRoBERTa: A RoBERTa Model for Assamese Language},
4 year = {2025},
5 publisher = {HuggingFace},
6 howpublished = {\url{https://huggingface.co/MWirelabs/assamese-roberta}}
7}