Views
No views yet
roberta-base-bahasa-cased model was pretrained on ~400 miliion words. Below is list of data we trained on,kebudayaan, keagaaman and etnik, https://github.com/huseinzol05/malay-dataset/tree/master/dumping/clean1from transformers import AutoTokenizer, AutoModelForMaskedLM, pipeline
2
3model = AutoModelForMaskedLM.from_pretrained('mesolitica/roberta-base-bahasa-cased')
4tokenizer = AutoTokenizer.from_pretrained(
5 'mesolitica/roberta-base-bahasa-cased',
6 do_lower_case = False,
7)
8fill_mask = pipeline('fill-mask', model=model, tokenizer=tokenizer)
9fill_mask('Permohonan Najib, anak untuk dengar isu perlembagaan <mask> .')1[{'score': 0.3368818759918213,
2 'token': 746,
3 'token_str': ' negara',
4 'sequence': 'Permohonan Najib, anak untuk dengar isu perlembagaan negara.'},
5 {'score': 0.09646568447351456,
6 'token': 598,
7 'token_str': ' Malaysia',
8 'sequence': 'Permohonan Najib, anak untuk dengar isu perlembagaan Malaysia.'},
9 {'score': 0.029483484104275703,
10 'token': 3265,
11 'token_str': ' UMNO',
12 'sequence': 'Permohonan Najib, anak untuk dengar isu perlembagaan UMNO.'},
13 {'score': 0.026470622047781944,
14 'token': 2562,
15 'token_str': ' parti',
16 'sequence': 'Permohonan Najib, anak untuk dengar isu perlembagaan parti.'},
17 {'score': 0.023237623274326324,
18 'token': 391,
19 'token_str': ' ini',
20 'sequence': 'Permohonan Najib, anak untuk dengar isu perlembagaan ini.'}]