Views
No views yet
1from transformers import AutoTokenizer
2tokenizer = AutoTokenizer.from_pretrained("gsar78/tokenizer_BPE_en_el")
3from transformers import AutoTokenizer
4tokenizer = AutoTokenizer.from_pretrained("gsar78/tokenizer_BPE_en_el")
5
6# Tokenize input text
7input_text = "This is a game"
8inputs = tokenizer(input_text, return_tensors="pt")
9
10# Print the tokenized input (IDs and tokens)
11print("Token IDs:", inputs["input_ids"].tolist())
12
13# Convert token IDs to tokens
14tokens = tokenizer.convert_ids_to_tokens(inputs["input_ids"][0])
15print("Tokens:", tokens)
16
17# Manually join tokens to form the tokenized string
18tokenized_string = ' '.join(tokens)
19print("Tokenized String:", tokenized_string)1# Output:
2Token IDs: [[2967, 317, 220, 1325]]
3Tokens: ['This', 'Ġis', 'Ġa', 'Ġgame']
4Tokenized String: This Ġis Ġa Ġgame