Views
No views yet
indobenchmark/indobert-base-p1 architecture and further pretrained using Masked Language Modeling (MLM) on an Islamic corpus.| Parameter | Value |
|---|---|
| Model Type | BERT (Bidirectional Encoder Representations from Transformers) |
| Base Model | indobenchmark/indobert-base-p1 |
| Task | Masked Language Modeling (MLM) |
| Language | Indonesian |
| Domain | Islamic / Religious Texts |
| Parameters | 124,492,880 |
| Tensor Type | F32 |
| Parameter | Value |
|---|---|
| Corpus | Quran (6,236 verses) + Sahih Bukhari (7,008) + Sahih Muslim (5,362) |
| Total Documents | 18,606 |
| Epochs | 10 |
| Batch Size | 8 |
| Learning Rate | 5e-5 |
| Optimizer | AdamW |
| Total Steps | 10,470 |
| Final Training Loss | ~1.2473 |
| Final Validation Loss | ~1.1415 |
1from transformers import AutoModelForMaskedLM, AutoTokenizer
2
3model_id = "irwan19/albertir-quran-hadith"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForMaskedLM.from_pretrained(model_id)
6
7# Example: Fill-mask prediction
8text = "Umat Islam wajib melaksanakan ibadah [MASK] di bulan Ramadhan."
9inputs = tokenizer(text, return_tensors="pt")
10outputs = model(**inputs)
11# Prediksi: 'puasa'