This model is pretrained on Sinhala data resources.
hidden_size = 786
num_hidden_layers = 6
num_attention_heads = 6
intermediate_size = 1024
Epoch Training Loss Validation Loss
1 3.946600 3.898129
2 3.782100 3.800080
3 3.678300 3.706316
4 3.485600 3.646217
5 3.480900 3.601913
6 3.420000 3.615573