Views
No views yet
solar-docvision-preview tokenizersolar-docvision-preview model.1from tokenizers import Tokenizer
2
3tokenizer = Tokenizer.from_pretrained("upstage/solar-docvision-preview-tokenizer")
4
5text = "Hi, how are you?"
6enc = tokenizer.encode(text)
7print("Encoded input:")
8print(enc)
9
10inv_vocab = {v: k for k, v in tokenizer.get_vocab().items()}
11tokens = [inv_vocab[token_id] for token_id in enc.ids]
12print("Tokens:")
13print(tokens)
14
15number_of_tokens = len(enc.ids)
16print("Number of tokens:", number_of_tokens)