Views
No views yet
1from transformers import XLMRobertaTokenizer
2import torch
3from model import KhmerTagger
4
5# Load tokenizer
6tokenizer = XLMRobertaTokenizer.from_pretrained("FacebookAI/xlm-roberta-base")
7
8# Load model
9model = KhmerTagger(n_punct_features=5, n_num_features=3)
10model.load_state_dict(torch.load("pytorch_model.bin", map_location="cpu", weights_only=True))
11model.eval()
12
13# Your inference code here...1@misc{khmertagger2025,
2 author = {Seanghay Yath},
3 title = {KhmerTagger: Inverse Text Normalization for Khmer Automatic Speech Recognition},
4 year = {2025},
5 publisher = {GitHub},
6 journal = {GitHub repository},
7 howpublished = {\url{https://github.com/seanghay/khmertagger}},
8 note = {Open source project for Khmer punctuation restoration and number recognition using XLM-ROBERTa}
9}