Views
No views yet
BertTokenizer, where each Chinese character is a separate token. This was a design decision to facilitate sequence tagging tasks. It also supports mixed Chinese and English text.1from transformers import pipeline
2fill_mask = pipeline(
3 "fill-mask",
4 model="ming030890/modernbert-base-chinese",
5 tokenizer="ming030890/modernbert-base-chinese"
6)
7
8# Mainland Mandarin (Simplified Chinese)
9result = fill_mask("今天天[MASK]真好。")
10print(result)
11
12# Traditional Chinese Example
13result = fill_mask("這碗牛[MASK]麵好吃。")
14print(result)
15
16# Cantonese Example
17result = fill_mask("你咁樣做真係[MASK]衰。")
18print(result)
19
20# Mixed Chinese and English Example — code switching
21result = fill_mask("我啱啱買咗[MASK]新laptop。")
22print(result)1from transformers import AutoTokenizer, AutoModelForMaskedLM
2
3tokenizer = AutoTokenizer.from_pretrained("ming030890/modernbert-base-chinese")
4model = AutoModelForMaskedLM.from_pretrained("ming030890/modernbert-base-chinese")