A Vietnamese RoBERTa-based language model pre-trained on CC-100 Vietnamese and custom Vietnamese corpus.
1from transformers import AutoModel, AutoTokenizer
2
3# Load model and tokenizer
4tokenizer = AutoTokenizer.from_pretrained("mainguyen9/viBERT-base")
5model = AutoModel.from_pretrained("mainguyen9/viBERT-base")
6
7# Encode text
8text = "Xin chào Việt Nam"
9inputs = tokenizer(text, return_tensors="pt")
10outputs = model(**inputs)
11
12# Get embeddings
13last_hidden_state = outputs.last_hidden_state
1from transformers import pipeline
2
3fill_mask = pipeline("fill-mask", model="mainguyen9/viBERT-base")
4result = fill_mask("Hà Nội là [MASK] đô của Việt Nam.")
5print(result)
1from transformers import AutoModelForTokenClassification, AutoTokenizer
2
3model = AutoModelForTokenClassification.from_pretrained(
4 "mainguyen9/viBERT-base",
5 num_labels=num_labels
6)
7tokenizer = AutoTokenizer.from_pretrained("mainguyen9/viBERT-base")
Fine-tuned with 5 epochs, batch size 32, learning rate 2e-5.
Fine-tuned with 5 epochs, batch size 64, learning rate 2e-5.
Fine-tuned with 5 epochs, batch size 8, learning rate 2e-5.
1@misc{vibert-base,
2 author = {Mai Nguyen},
3 title = {viBERT-base: A Vietnamese RoBERTa Model},
4 year = {2024},
5 publisher = {Hugging Face},
6 url = {https://huggingface.co/mainguyen9/viBERT-base}
7}