Views
No views yet
<|endoftext|>: BOS/EOS/UNK token<|padding|>: Padding tokenTraining tokenizer on all samples...
[Info] Tokenizer 10000 vocabs saved to './bpe-10.0k-tinystories'
--- Test ---
Input: Once upon a time, there was a tiny dragon.
Tokens: [7013, 2402, 247, 673, 13, 627, 369, 247, 5888, 10295, 15]
Decoded: Once upon a time, there was a tiny dragon.1from transformers import PreTrainedTokenizerFast
2
3tokenizer = PreTrainedTokenizerFast.from_pretrained("vuiseng9/bpe-10.0k-tinystories")
4
5# Encode text
6text = "Once upon a time, there was a tiny dragon."
7tokens = tokenizer.encode(text)
8print(tokens)
9
10# Decode tokens
11decoded = tokenizer.decode(tokens)
12print(decoded)1# Full training on entire dataset
2python train_bpe.py --real
3
4# see more options
5python train_bpe.py -h
6