Views
No views yet
1from transformers import LlamaTokenizer
2
3tokenizer = LlamaTokenizer.from_pretrained(
4 'ocisd4/openllama_tokenizer_ext_zh',
5 add_bos_token=True,
6 add_eos_token=False,
7 use_auth_token='True',
8)
9
10print('vocab size:',tokenizer.vocab_size)
11#vocab size: 52928
12
13text = '今天天氣真好!'
14
15
16print(tokenizer.tokenize(text))
17#['▁', '今天', '天氣', '真', '好', '<0xEF>', '<0xBC>', '<0x81>']
18
19print(tokenizer.encode(text))
20#[1, 31822, 32101, 32927, 45489, 45301, 242, 191, 132]
21
22print(tokenizer.decode(tokenizer.encode(text)))
23# 今天天氣真好!</s>